Короткий ответ
DeepSeek V4 Flash — бюджетная модель семейства V4 от DeepSeek, вышедшая в публичную бету 31 июля 2026 года. Это самый дешёвый из крупных LLM API, которые мы отслеживали в этом году: $0.14 за миллион входных токенов и $0.28 за миллион выходных, контекстное окно 1M токенов и лицензия MIT с правом коммерческого использования. В задачах по коду в пределах одного файла, в агентных циклах и при массовом переводе V4 Flash не уступает моделям, которые стоят в 10–50 раз дороже. Получить к ней доступ можно напрямую через API DeepSeek или через единый шлюз вроде TeamoRouter — вместе с Claude, GPT, Gemini и Kimi, по одному ключу.
Почему DeepSeek V4 Flash важна
В каждом поколении моделей есть свой «король цены». В 2024 году это была DeepSeek V3. В 2025-м — DeepSeek-R1 и первые превью V4. В середине 2026 года корона принадлежит DeepSeek V4 Flash, причём с большим отрывом.
Официальный релиз deepseek-v4-flash-20260731 (встречается также написание DeepSeek-V4-Flash-0731) вышел 31 июля 2026 года. Это существенное обновление по сравнению с апрельским превью: по словам DeepSeek, прирост дало дообучение (а именно повторное дообучение на агентных данных и данных по разработке кода), а не увеличение сети. В результате получилась модель, которая будто создана специально для двух задач, на которые разработчики тратят больше всего денег: генерация кода и запуск автономных агентов.
| Характеристика | DeepSeek V4 Flash |
|---|---|
| Релиз | 31 июля 2026 года (публичная бета) |
| Архитектура | Разреженная MoE, 284B параметров всего / 13B активных |
| Лицензия | MIT (коммерческое использование разрешено) |
| Контекстное окно | 1M токенов |
| Максимальный вывод | 384K токенов |
| Вход (промах кэша) | $0.14 / 1M токенов |
| Вход (попадание в кэш) | $0.0028 / 1M токенов |
| Выход | $0.28 / 1M токенов |
| Рассуждения по умолчанию | Режим thinking включён |
Главная цифра — цена. При $0.14/$0.28 V4 Flash дешевле, чем:
- GPT-5.6 Sol ($5.00/$30.00) — примерно в 36 раз на входе и в 107 раз на выходе
- Claude Opus 4.8 ($5.00/$25.00) — с похожим отрывом
- DeepSeek V4 Pro ($0.435/$0.87) — примерно в 3 раза
Для сравнения: GPT-5.6 Sol стоит $5.00/$30.00 за миллион токенов, а Claude Opus 4.8 — $5.00/$25.00, так что V4 Flash примерно на порядок дешевле всей группы флагманов.
Архитектура: мало активных вычислений, огромный контекст
V4 Flash построена на разреженной архитектуре mixture-of-experts (MoE). Всего в модели 284B параметров, но на каждый токен активируются только 13B. Именно это делает её быстрой и дешёвой в обслуживании, и именно поэтому DeepSeek может позволить себе такую агрессивную цену, сохраняя контекстное окно в 1M токенов и до 384K токенов на выходе.
На практике это значит, что V4 Flash может прочитать целый репозиторий среднего размера, спланировать работу по нему и выдать очень длинный ответ — без склейки контекста из фрагментов. Для агентных фреймворков, которые ведут длинный непрерывный транскрипт, это важнее сырых баллов в бенчмарках.
Режим thinking включён по умолчанию
В отличие от большинства дешёвых моделей, V4 Flash поставляется с включёнными по умолчанию рассуждениями. Управлять ими можно параметрами thinking и reasoning_effort. Два нюанса, которые стоит запомнить:
- Пока включён режим thinking,
temperatureиtop_pни на что не влияют. Если вам нужно управлять сэмплированием, сначала отключите thinking. - Дополнение fill-in-the-middle (FIM) — функция, на которую опирается автодополнение в IDE, — работает только без режима thinking.
from openai import OpenAI
client = OpenAI(
api_key="sk-your-deepseek-key",
base_url="https://api.deepseek.com",
)
# Default: thinking mode on
resp = client.chat.completions.create(
model="deepseek-v4-flash",
messages=[
{"role": "user", "content": "Write a Python function that retries an HTTP request with exponential backoff and jitter."}
],
)
print(resp.choices[0].message.content)
Результаты бенчмарков: агентные задачи и код
Июльский релиз принёс реальный прирост в агентных задачах. DeepSeek опубликовала такие результаты для сборки 0731:
| Бенчмарк | V4 Flash (0731) | Что измеряет |
|---|---|---|
| TerminalBench 2.1 | 82.7 | Операции в терминале / CLI |
| Cybergym | 76.7 | Симуляция задач кибербезопасности |
| Toolathlon (verified) | 70.3 | Точность вызова инструментов |
| DSBench-FullStack | 68.7 | Задачи фулстек-разработки |
| DSBench-Hard | 59.6 | Сложные задачи по программированию |
| DeepSWE | 54.4 | Агент для программной инженерии |
По данным DeepSeek, эти показатели находятся на уровне превью V4-Pro или выше, а общий агентный балл — около 25.2, что близко к 25.7 у Claude Opus 4.8. Независимые тесты разработчиков в первые дни после запуска подтверждают, что модель действительно пригодна для реальных агентных задач: один инженер прогнал цикл «чтение файлов + веб-поиск + суммаризация» примерно за 40 секунд, потратив 510K токенов, — всего около ¥0.53 RMB.
Честная оговорка: V4 Flash — не архитектор многофайловых проектов. При генерации и правках в пределах одного файла она близка по качеству к V4 Pro. На крупных рефакторингах, затрагивающих несколько модулей, она слабее V4 Pro и заметно слабее Claude Opus 4.8 или GPT-5.6 Sol. Сама DeepSeek позиционирует Flash как «исполнителя», а Pro — как «планировщика».
Гибридный процесс: Pro планирует, Flash исполняет
Поскольку 60–80% расходов токенов при работе с кодом приходится на слой исполнения — ту часть, где модель пишет файлы, запускает тесты и исправляет ошибки линтера, — перенос исполнения на Flash остаётся самым мощным рычагом экономии в 2026 году.
Рекомендуемая схема выглядит так:
V4 Pro (планирование + ревью архитектуры) -- ~20% токенов
V4 Flash (генерация файлов, правки, написание тестов) -- ~70% токенов
V4 Pro (финальное ревью) -- ~10% токенов
Собственные расчёты DeepSeek показывают, что такое сочетание сокращает расходы на API примерно на 64% по сравнению с использованием V4 Pro везде. Арифметика простая: процесс целиком на Pro стоит в 3 раза дороже процесса целиком на Flash, а гибрид обходится примерно в 36% от стоимости варианта «всё на Pro».
Конфигурация маршрутизации, которая делает это автоматически
Если вы хотите гибрид без ручного переключения, LLM-маршрутизатор превращает это в механику. С Agentic Routing в TeamoRouter можно задать веса качества, стоимости и задержки для каждого типа задач, чтобы простые правки автоматически попадали на deepseek-v4-flash, а планирование архитектуры уходило на deepseek-v4-pro или claude-opus-4-8:
# example agentic routing rule (TeamoRouter dashboard / Agentic Routing)
rules:
- name: quick-edits
match: task_type == "code_edit" or task_type == "test_write"
model: deepseek-v4-flash
- name: architecture
match: task_type == "plan" or task_type == "design_review"
model: deepseek-v4-pro
- name: fallback
match: "*"
model: deepseek-v4-flash
Один ключ, одна консоль, и каждая модель тарифицируется по сниженным ценам TeamoRouter (обычно за 10–20% от официальной цены, одной строкой в биллинге).
Доступ к API: два совместимых эндпоинта
DeepSeek намеренно сделала V4 Flash совместимой «из коробки». Никакой SDK от DeepSeek не нужен:
- OpenAI-совместимый:
https://api.deepseek.com(поддерживает и Responses API) - Anthropic-совместимый:
https://api.deepseek.com/anthropic
ID модели — просто deepseek-v4-flash. Если вы пользовались старыми именами deepseek-chat или deepseek-reasoner, учтите, что вывод обоих из эксплуатации был запланирован на 24 июля 2026 года — переходить на deepseek-v4-flash / deepseek-v4-pro нужно уже сейчас.
OpenAI Responses API (для агентов)
На момент релиза 0731 V4 Flash — единственная модель DeepSeek с нативной поддержкой OpenAI Responses API и официальной интеграцией с Codex. Поддержка V4 Pro ожидалась в начале августа 2026 года. Поэтому Flash — естественный выбор для стеков на OpenAI-агентах, куда хочется подставить дешёвую модель:
from openai import OpenAI
client = OpenAI(
api_key="sk-your-deepseek-key",
base_url="https://api.deepseek.com",
)
resp = client.responses.create(
model="deepseek-v4-flash",
input="Analyze the failing tests in this repo and propose fixes.",
)
print(resp.output_text)
Через TeamoRouter
Через TeamoRouter та же модель доступна по единому ключу вместе со всеми остальными провайдерами:
from openai import OpenAI
client = OpenAI(
api_key="tr-your-key-here",
base_url="https://api.teamorouter.com/v1",
)
resp = client.chat.completions.create(
model="deepseek-v4-flash",
messages=[{"role": "user", "content": "Optimize this Dockerfile and reduce the image size."}],
)
print(resp.choices[0].message.content)
Если ваш стек уже работает в формате OpenAI, поменять нужно только base_url и ключ.
Подробнее о ценах и пиковых часах
Два факта о ценах, которые стоит учитывать при планировании:
-
Попадания в кэш примерно в 50 раз дешевле промахов. При $0.0028/M за вход с попаданием в кэш долгие агентные сессии со стабильным системным промптом становятся почти бесплатными. Если держать системный промпт неизменным и переиспользовать контекст, эффективная стоимость входа падает в разы. Это самая важная оптимизация для агентных нагрузок на V4 Flash.
-
Грядёт пиковая тарификация. DeepSeek объявила, что в пиковые часы по пекинскому времени (9:00–12:00 и 14:00–18:00) цены вырастут до 2x от обычного тарифа ($0.56/M за выход). На момент запуска 31 июля это ещё не действовало — но будет. Командам с гибкими пакетными нагрузками стоит планировать неинтерактивные задачи вне этих окон или дать маршрутизатору переводить их на более дешёвую модель, когда цена переключается.
| Нагрузка | V4 Flash вне пика | V4 Flash в пик (2x) | V4 Pro |
|---|---|---|---|
| 1M вход / 1M выход | $0.42 | $0.84 | $1.31 |
| 5M вход / 2M выход | $1.26 | $2.52 | $3.92 |
| 10M вход / 5M выход | $2.80 | $5.60 | $8.70 |
Стоит ли переводить свой стек для кода на V4 Flash?
Переходите на V4 Flash, если...
- Вы генерируете много кода в пределах одного файла — тесты, шаблонный код, небольшие функции, скрипты. Разрыв в качестве с флагманскими моделями невелик, а разрыв в цене огромен.
- Вы гоняете агентов в длинных циклах. Контекст 1M + дешёвые попадания в кэш + 2 500 параллельных запросов — сочетание, созданное для трафика автономных агентов.
- Вы платите за каждый токен (то есть работаете через API, а не по фиксированной подписке). При $0.14/$0.28 месяц интенсивной работы с кодом может обойтись в $10–20 там, где на флагмане вышло бы $200+.
- Вы находитесь в Китае или вам нужна модель под лицензией MIT, которую со временем можно развернуть у себя. V4 Flash можно использовать в коммерческих целях без ограничений.
Оставайтесь на текущей модели, если...
- Вы занимаетесь крупной многофайловой архитектурной работой. Flash слабее V4 Pro, Claude Opus 4.8 и GPT-5.6 Sol в координации изменений между модулями.
- Вам нужна работа с изображениями. V4 Flash не принимает изображения на вход (как и V4 Pro). Для мультимодальных задач держите под рукой GPT-5.6 Sol или Claude.
- Вам нужна максимальная глубина рассуждений на сложных, нестандартных задачах. Flash — исполнитель, а не архитектор: для таких задач берите модель-планировщик, а черновую работу отдавайте Flash.
Итог
DeepSeek V4 Flash — лучшая по соотношению цены и качества модель для кода, доступная большинству разработчиков прямо сейчас. Это не самая способная модель — это самая эффективная. Если в паре с ней использовать модель-планировщик (V4 Pro или Claude) для архитектуры, а исполнение направлять через Flash, вы получаете качество, близкое к флагманскому, за малую долю стоимости. Экономия 64% в гибридном процессе — из тех цифр, что выдерживают столкновение с реальностью, потому что она берётся оттуда, куда ваши токены на самом деле уходят.
TeamoRouter даёт обе части этого уравнения по одному ключу: deepseek-v4-flash для слоя исполнения, deepseek-v4-pro, claude-opus-4-8 или gpt-5.6-sol для планирования и Agentic Routing для автоматического переключения между ними. Зарегистрируйтесь, пополните баланс через Alipay или WeChat Pay и начинайте маршрутизировать — без VPN и без международной карты.
FAQ
DeepSeek V4 Flash бесплатна?
Нет. API платный: $0.14/M за вход и $0.28/M за выход (вход с попаданием в кэш стоит $0.0028/M). Тем не менее это самый дешёвый API крупной модели в 2026 году, и небольшие нагрузки обходятся в копейки.
DeepSeek V4 Flash — это open source?
Веса распространяются под лицензией MIT с правом коммерческого использования, но основной канал распространения — хостируемый API DeepSeek. Правильнее всего думать об этом как об «открытых весах с коммерческим хостируемым API».
Поддерживает ли DeepSeek V4 Flash изображения?
Нет. V4 Flash (как и V4 Pro) работает только с текстом. Для ввода изображений используйте GPT-5.6 Sol или Claude.
Можно ли использовать DeepSeek V4 Flash в Claude Code или Codex?
В Codex — да: у V4 Flash есть официальная интеграция с Codex. Совместимость с Claude Code возможна через Anthropic-совместимый эндпоинт или через маршрутизатор/шлюз; многие команды используют её как дешёвую вторую модель рядом с Claude.
Какое у неё контекстное окно?
1M токенов и до 384K токенов на выходе. Этого достаточно, чтобы обработать целый репозиторий или длинный транскрипт агента за один вызов.
Чем DeepSeek V4 Flash отличается от DeepSeek V4 Pro?
V4 Pro ($0.435/$0.87) — более сильный архитектор и планировщик; V4 Flash ($0.14/$0.28) — более быстрый и дешёвый исполнитель. Используйте Pro для многофайлового планирования, а Flash — для массовой генерации: гибрид снижает затраты примерно на 64% по сравнению с работой только на Pro.
Как получить доступ к DeepSeek V4 Flash из Китая?
Напрямую через API DeepSeek или через TeamoRouter, который объединяет DeepSeek с Claude, GPT, Gemini и Kimi под одним ключом и поддерживает оплату через Alipay/WeChat Pay.