Модели DeepSeek

Будущие модели

DeepSeek-V4

DeepSeek-V4 — следующее поколение флагманской модели. Ожидается в составе трёх специализированных версий:

DeepSeek V4 Lite — облегчённая и быстрая версия для работы в режиме Fast.

DeepSeek V4 — основная версия с режимом глубоких рассуждений Expert.

DeepSeek V4 Vision — версия с продвинутыми мультимодальными возможностями, работает в режиме Vision.

Планируемая дата публичного релиза: 15 мая 2026 года (по состоянию на начало 2026 года модель находится в стадии закрытого бета-тестирования).

Ожидаемые технические характеристики

Масштаб: до 1 триллиона параметров; контекстное окно — 1 миллион токенов.

Архитектурные инновации (по предварительной информации):

Manifold-Constrained Hyper-Connections (mHC) — архитектура для повышения стабильности обучения сверхбольших моделей.

Engram Conditional Memory — механизм условной памяти, имитирующий эффективное хранение и доступ к информации.

DeepSeek Sparse Attention — улучшенный механизм разреженного внимания для обработки сверхдлинного контекста.

Актуальные флагманские модели

DeepSeek-V3

DeepSeek-V3 — универсальная языковая модель флагманского уровня. Построена на архитектуре Mixture-of-Experts (MoE).

Технические параметры

Общее количество параметров: 671 миллиард.

Активных параметров на токен: 37 миллиардов (благодаря разреженной активации MoE).

Объём обучающих данных: 14.8 триллионов высококачественных токенов.

Ключевые технологии: Multi-Head Latent Attention (MLA) для эффективной работы с длинными текстами; Multi-Token Prediction (MTP) для ускорения генерации.

Версии

DeepSeek-V3.1 и DeepSeek-V3.2 (также обозначаемая как V3.2-Exp) — итеративные улучшения, добавляющие поддержку Function Calling (вызов функций) и улучшенное следование инструкциям.

DeepSeek-V3 Lite — упрощённая версия с уменьшенным числом параметров, предназначенная для задач, не требующих максимальной мощности.

DeepSeek-R1

DeepSeek-R1 — модель, оптимизированная для задач, требующих высокой точности и пошагового рассуждения. Использует обучение с подкреплением (Reinforcement Learning, RL) для генерации цепочек рассуждений (Chain-of-Thought).

Версии

DeepSeek-R1-Zero — первая экспериментальная версия, обученная исключительно с помощью RL без предварительного supervised fine-tuning (SFT). Демонстрирует саморефлексию, но может выдавать менее структурированные ответы.

DeepSeek-R1 — улучшенная версия: перед RL добавлен этап SFT на «холодных» данных, что повышает читаемость и языковую согласованность ответов.

DeepSeek-R1 Pro — вариант с расширенными возможностями обработки данных и поддержкой более сложных запросов.

Применение

Используется в веб-интерфейсе и API DeepSeek как режим DeepThink (включается отдельной кнопкой). Оптимизирована для работы на устройствах с ограниченными ресурсами по сравнению с V3.

Мультимодальные и специализированные модели

DeepSeek-VL2

DeepSeek-VL2 — модель для понимания изображений. Построена на той же эффективной MoE-архитектуре, что и V3. Поддерживает описание изображений, ответы на вопросы по картинкам, распознавание текста (OCR) и анализ диаграмм.

Janus / Janus-Pro

Janus — серия моделей, объединяющая понимание и генерацию изображений. Janus-Pro — улучшенная версия с оптимизированным обучением и увеличенным размером, обеспечивающая более высокое качество в обеих задачах.

Дистиллированные модели

Дистилляция — процесс переноса знаний большой модели (DeepSeek-R1) в компактные архитектуры путём дообучения (fine-tune) на ответах и цепочках рассуждений учителя. Полученные модели сохраняют значительную часть способностей к рассуждению при малых вычислительных затратах.

Дистиллированные модели на основе Qwen

DeepSeek-R1-Distill-Qwen-1.5B — версия с 1.5 млрд параметров.

DeepSeek-R1-Distill-Qwen-7B — версия с 7 млрд параметров.

DeepSeek-R1-Distill-Qwen-14B — версия с 14 млрд параметров.

DeepSeek-R1-Distill-Qwen-32B — версия с 32 млрд параметров.

Qwen-Distilled-Small — миниатюрная версия для устройств с крайне ограниченными ресурсами (мобильные устройства, встраиваемые системы).

Дистиллированные модели на основе Llama

DeepSeek-R1-Distill-Llama-8B — версия с 8 млрд параметров.

DeepSeek-R1-Distill-Llama-70B — версия с 70 млрд параметров.

Llama-Distilled-Multilingual — многоязычная версия, оптимизированная для одновременной работы с текстами на нескольких языках.

Дистиллированные модели DeepSeek предназначены для локального запуска на обычных компьютерах, в мобильных приложениях и проектах с ограниченным бюджетом на вычислительные ресурсы.

См. также Дополнительные режимы и опции