Технический анализ архитектуры и методологий DeepSeek-V3.2

Основной фокус модели DeepSeek-V3.2 сделан на преодолении ключевых недостатков открытых LLM: неэффективности работы с длинным контекстом, недостаточного объема послетренировочных вычислений и отставания в обобщающей способности и надежности для агентских сценариев.

1. Архитектура внимания: DeepSeek Sparse Attention (DSA)

Ключевым усовершенствованием в DeepSeek-V3.2 является замена стандартного механизма внимания на DeepSeek Sparse Attention (DSA). Эта гибридная архитектура радикально снижает вычислительную сложность с O(L²) до O(Lk), где k (<< L) — количество выбираемых токенов, при сохранении производительности на длинном контексте (128K токенов).

Принцип работы DSA состоит из двух компонентов:

1. Lightning Indexer: Быстрый индексный модуль, вычисляющий оценку релевантности It,s между текущим запросным токеном ht и каждым предыдущим токеном hs в контексте. Для скорости вычислений используется активация ReLU, а сам модуль, имеющий небольшое количество голов, может исполняться в формате FP8. Формула расчета: It,s = Σj=1Hl wt,jl · ReLU(qt,jl · ksl).

2. Fine-grained Token Selection: Механизм выбора на основе индекса. Для каждого запросного токена отбираются только ключ-значение пары {cs}, соответствующие топ-k наибольшим индексным оценкам It,s. Стандартное внимание вычисляется только для этого разреженного множества: ut = Attn(ht, {cs | It,s ∈ Top-k(It,s)}).

Интеграция и обучение DSA проводилось поэтапно поверх MLA (Multi-head Latent Attention) из DeepSeek-V3.1-Terminus для совместимости:

a) Плотная "разогревочная" стадия: Инициализация lightning indexer при замороженных остальных параметрах модели. Цель — выравнивание выходов индексера с распределением основного внимания. Используется KL-дивергенция между нормализованными весами основного внимания и softmax выходами индексера. Обучение велось 1000 шагов на 2.1B токенах.

b) Разреженная тренировочная стадия: После инициализации индексера активируется полный механизм DSA, и оптимизируются все параметры модели. На этом этапе KL-дивергенция считается только для выбранного подмножества токенов St. Важно, что градиент от индексера не распространяется на основную модель, что обеспечивает раздельную оптимизацию. Стадия длилась 15000 шагов на ~944B токенах с learning rate 7.3e-6, выбирая k=2048 ключ-значений на запрос.

2. Масштабируемое обучение с подкреплением (RL)

Второй столп улучшений — значительное увеличение вычислительного бюджета на этапе посттренинга (свыше 10% от стоимости предтренинга) и стабилизация процесса RL с использованием модифицированного алгоритма Group Relative Policy Optimization (GRPO).

Были внедрены ключевые модификации для стабильного масштабирования:

• Несмещенная оценка KL-дивергенции: Вместо стандартного K3-эстиматора используется оценка, скорректированная через importance-sampling ratio между текущей и старой политикой. Это устраняет систематическую ошибку и предотвращает нестабильность, возникающую, когда πθ << πref.

• Маскирование внеполитичных последовательностей (Off-Policy Sequence Masking): Для повышения толерантности к несоответствию между политикой сбора данных и обучаемой политикой вводится бинарная маска M. Она обнуляет вклад в loss для последовательностей с отрицательным advantage и высокой KL-дивергенцией между старой и текущей политикой. Это предотвращает дестабилизацию от сильно "устаревших" негативных сэмплов.

• Фиксация маршрутизации в MoE (Keep Routing): Для моделей с архитектурой Mixture of Experts (MoE) фиксируются пути активации экспертов, использованные при сэмплировании. Это гарантирует согласованность активного параметрического подпространства между инференсом и обучением, смягчая проблемы внеполитичности.

• Фиксация маски сэмплирования (Keep Sampling Mask): Маски усечения (top-p, top-k), примененные при генерации данных старой политикой, сохраняются и накладываются на вероятности текущей политики во время обучения. Это обеспечивает согласованность пространства действий и стабилизирует importance sampling.

Стратегия посттренинга включает специализированную дистилляцию и смешанный RL-тренинг:

1. Дистилляция от специалистов: От основного чекпоинта дообучаются узкоспециализированные модели для шести доменов (математика, программирование, логика, агентские задачи и др.). Эти специалисты обучаются с интенсивным RL. Их выходы (как в "thinking", так и в "non-thinking" режиме) используются для создания дистиллированных данных для основной модели.

2. Смешанный RL-тренинг: Обучение на объединенных данных для рассуждений, агентских задач и выравнивания происходит в одной стадии, что балансирует производительность и предотвращает катастрофическое забывание. Для разных типов задач используются разные функции вознаграждения: rule-based outcome reward, length penalty, language consistency reward для рассуждений/агентов и генеративная модель вознаграждения с рубриками для общих задач.

3. Интеграция рассуждений в инструментарий (Thinking in Tool-Use)

Для преодоления разрыва между способностью к рассуждению и эффективным использованием инструментов разработана многоступенчатая методология.

3.1. Управление контекстом рассуждений: В отличие от DeepSeek-R1, где цепочка мыслей сбрасывается после каждого шага, введена гибкая стратегия удержания. Цепочка рассуждений сохраняется на протяжении всей сессии вызовов инструментов и очищается только при получении нового пользовательского сообщения. Это предотвращает избыточную регенерацию одних и тех же размышлений для каждого последующего шага.

3.2. Холодный старт (Cold-Start): Начальная фаза, использующая методологию DeepSeek-V3. Объединяет данные для рассуждений (без инструментов) и данные для использования инструментов (без рассуждений) через тщательно сконструированные системные промпты. Модель обучается следовать инструкциям, которые явно предписывают встраивать вызовы инструментов внутрь тегов размышлений . Это создает начальные, пусть и не всегда надежные, траектории для последующего RL.

3.3. Синтез агентских задач в большом масштабе: Для масштабируемого RL создано свыше 1800 сред и 85,000 комплексных промптов. Процесс включает:
• Поискового агента: Генерация QA-пар на основе поиска в вебе с последующей верификацией. Используется конвейер из нескольких агентов для сэмплирования сущностей, построения вопросов, генерации и валидации ответов.
• Кодового агента: Создание исполняемых сред для исправления программных ошибок на основе пар Issue-PR с GitHub. Среда считается успешной, если "золотой" патч исправляет тесты (F2P > 0) и не вызывает регрессий (P2F = 0).
• Агента-интерпретатора кода: Использование Jupyter Notebook для решения задач, требующих исполнения кода.
• Генерального агента: Автоматический синтез сред и задач (например, планирование поездки) с помощью агента, который итеративно усложняет задачу, создает инструменты и функции верификации, обеспечивая, что задача решается строго через интерфейс инструментов.

4. Экспериментальные результаты и анализ

Оценка проводилась по широкому спектру бенчмарков, включая MMLU-Pro, GPQA, LiveCodeBench, Codeforces, AIME, HMMT, а также специализированные агентские: Terminal Bench, SWE-bench, BrowseComp, τ²-Bench, MCP-Universe, Tool-Decathlon.

Ключевые наблюдения:

• Производительность рассуждений: DeepSeek-V3.2 достигает уровня GPT-5-High, немного уступая Gemini-3.0-Pro. Прирост напрямую коррелирует с объемом вычислений на RL-стадии.

• Агентские возможности: Модель существенно сокращает разрыв между открытыми и закрытыми LLM в использовании инструментов, демонстрируя способность к обобщению на непредвиденные среды.

• Влияние синтетических данных: Абляционные эксперименты подтвердили, что RL исключительно на синтезированных агентских задачах приводит к значительному улучшению на сторонних бенчмарках (Tau2Bench, MCP), в то время как RL только на реальных средах (код, поиск) такого улучшения не дает.

• Управление контекстом: Для обхода ограничения в 128K токенов в поисковых сценариях были протестированы стратегии Summary, Discard-75%, Discard-all. Наилучший баланс эффективности и производительности показала простая стратегия Discard-all (сброс всей истории вызовов инструментов).

DeepSeek-V3.2-Speciale: Экспериментальный вариант с ослабленным штрафом за длину и дополнительными математическими данными. Показал наивысшие результаты, превзойдя Gemini-3.0-Pro на ряде бенчмарков и достигнув золотого медального уровня на IOI и IMO. Однако его эффективность по токенам значительно ниже, что подчеркивает компромисс между производительностью и стоимостью инференса.

5. Ограничения и направления будущей работы

Существуют три ключевых ограничения модели:

1. Широта знаний: Из-за меньшего общего объема тренировочных FLOPs энциклопедические знания уступают ведущим проприетарным моделям. Планируется масштабирование предтренинга.

2. Эффективность токенов: Для достижения того же качества вывода модель генерирует более длинные цепочки. Необходима оптимизация "плотности интеллекта" в рассуждениях.

3. Решение комплексных задач: Производительность на самых сложных интегрированных задачах все еще ниже, что требует улучшений в базовой архитектуре и рецептах посттренинга.

Основные направления будущих исследований: дальнейшее масштабирование вычислений, оптимизация эффективности генерации и поиск оптимальных стратегий комбинирования последовательного (context management) и параллельного масштабирования вычислительных ресурсов на этапе инференса.