Модели DeepSeek
Будущие модели
DeepSeek-V4
DeepSeek-V4 — следующее поколение флагманской модели. Ожидается в составе трёх специализированных версий:
DeepSeek V4 Lite — облегчённая и быстрая версия для работы в режиме Fast.
DeepSeek V4 — основная версия с режимом глубоких рассуждений Expert.
DeepSeek V4 Vision — версия с продвинутыми мультимодальными возможностями, работает в режиме Vision.
Планируемая дата публичного релиза: 15 мая 2026 года (по состоянию на начало 2026 года модель находится в стадии закрытого бета-тестирования).
Ожидаемые технические характеристики
Масштаб: до 1 триллиона параметров; контекстное окно — 1 миллион токенов.
Архитектурные инновации (по предварительной информации):
Manifold-Constrained Hyper-Connections (mHC) — архитектура для повышения стабильности обучения сверхбольших моделей.
Engram Conditional Memory — механизм условной памяти, имитирующий эффективное хранение и доступ к информации.
DeepSeek Sparse Attention — улучшенный механизм разреженного внимания для обработки сверхдлинного контекста.
Актуальные флагманские модели
DeepSeek-V3
DeepSeek-V3 — универсальная языковая модель флагманского уровня. Построена на архитектуре Mixture-of-Experts (MoE).
Технические параметры
Общее количество параметров: 671 миллиард.
Активных параметров на токен: 37 миллиардов (благодаря разреженной активации MoE).
Объём обучающих данных: 14.8 триллионов высококачественных токенов.
Ключевые технологии: Multi-Head Latent Attention (MLA) для эффективной работы с длинными текстами; Multi-Token Prediction (MTP) для ускорения генерации.
Версии
DeepSeek-V3.1 и DeepSeek-V3.2 (также обозначаемая как V3.2-Exp) — итеративные улучшения, добавляющие поддержку Function Calling (вызов функций) и улучшенное следование инструкциям.
DeepSeek-V3 Lite — упрощённая версия с уменьшенным числом параметров, предназначенная для задач, не требующих максимальной мощности.
DeepSeek-R1
DeepSeek-R1 — модель, оптимизированная для задач, требующих высокой точности и пошагового рассуждения. Использует обучение с подкреплением (Reinforcement Learning, RL) для генерации цепочек рассуждений (Chain-of-Thought).
Версии
DeepSeek-R1-Zero — первая экспериментальная версия, обученная исключительно с помощью RL без предварительного supervised fine-tuning (SFT). Демонстрирует саморефлексию, но может выдавать менее структурированные ответы.
DeepSeek-R1 — улучшенная версия: перед RL добавлен этап SFT на «холодных» данных, что повышает читаемость и языковую согласованность ответов.
DeepSeek-R1 Pro — вариант с расширенными возможностями обработки данных и поддержкой более сложных запросов.
Применение
Используется в веб-интерфейсе и API DeepSeek как режим DeepThink (включается отдельной кнопкой). Оптимизирована для работы на устройствах с ограниченными ресурсами по сравнению с V3.
Мультимодальные и специализированные модели
DeepSeek-VL2
DeepSeek-VL2 — модель для понимания изображений. Построена на той же эффективной MoE-архитектуре, что и V3. Поддерживает описание изображений, ответы на вопросы по картинкам, распознавание текста (OCR) и анализ диаграмм.
Janus / Janus-Pro
Janus — серия моделей, объединяющая понимание и генерацию изображений. Janus-Pro — улучшенная версия с оптимизированным обучением и увеличенным размером, обеспечивающая более высокое качество в обеих задачах.
Дистиллированные модели
Дистилляция — процесс переноса знаний большой модели (DeepSeek-R1) в компактные архитектуры путём дообучения (fine-tune) на ответах и цепочках рассуждений учителя. Полученные модели сохраняют значительную часть способностей к рассуждению при малых вычислительных затратах.
Дистиллированные модели на основе Qwen
DeepSeek-R1-Distill-Qwen-1.5B — версия с 1.5 млрд параметров.
DeepSeek-R1-Distill-Qwen-7B — версия с 7 млрд параметров.
DeepSeek-R1-Distill-Qwen-14B — версия с 14 млрд параметров.
DeepSeek-R1-Distill-Qwen-32B — версия с 32 млрд параметров.
Qwen-Distilled-Small — миниатюрная версия для устройств с крайне ограниченными ресурсами (мобильные устройства, встраиваемые системы).
Дистиллированные модели на основе Llama
DeepSeek-R1-Distill-Llama-8B — версия с 8 млрд параметров.
DeepSeek-R1-Distill-Llama-70B — версия с 70 млрд параметров.
Llama-Distilled-Multilingual — многоязычная версия, оптимизированная для одновременной работы с текстами на нескольких языках.
Дистиллированные модели DeepSeek предназначены для локального запуска на обычных компьютерах, в мобильных приложениях и проектах с ограниченным бюджетом на вычислительные ресурсы.
См. также Дополнительные режимы и опции