Блог

DeepSeek Harness: подробный разбор нового агентного фреймворка

Краткий ответ

DeepSeek Harness — это среда исполнения агентов, которую DeepSeek строит с марта 2026 года. «Harness» («обвязка») — слой из инструментов, памяти, оркестрации субагентов и логики завершения, который надстраивается над моделью. Публичный дебют состоялся 31 июля 2026 года: агентные бенчмарки DeepSeek-V4-Flash были прогнаны в режиме «DeepSeek Harness 极简模式» (минималистичный режим). Цель заявлена прямо: равняться на Claude Code и участвовать в войне продуктов — агентов для программирования. Если вы хотите поэкспериментировать с агентными нагрузками того же класса уже сегодня, агентов на базе Flash можно запускать через TeamoRouter — одним ключом, наряду с Claude, GPT и Gemini.

Что на самом деле означает «Harness»

Индустрия ИИ сошлась на простой формуле:

text
Агент = модель + Harness

Модель — это мозг: веса, которые предсказывают токены. Harness — всё остальное: набор инструментов, которые агент может вызывать, файловая система и оболочка, к которым у него есть доступ, способ передачи информации между субагентами, хранение и извлечение контекста и — что критически важно — момент, когда выполнение останавливается. Термин популяризировала Anthropic в конце 2025 — начале 2026 года, описывая им всю среду исполнения вокруг Claude Code. «Голые» модели сами по себе плохо справляются с памятью, выполнением кода и вызовом инструментов; именно Harness превращает чат-модель в работника, который действительно способен выпускать код.

Такая постановка важна, потому что она переносит поле конкурентной борьбы. Когда флагманские модели выходят на сопоставимый уровень «сырых» возможностей, дифференциация смещается выше модели — в Harness. Поэтому DeepSeek — исторически чисто модельная компания — и развернула целое бизнес-направление Agent Harness.

Команда проекта

DeepSeek собрала команду Agent Harness в марте 2026 года как самостоятельное бизнес-направление с одним внутренним ориентиром: «对标 Claude Code,做 DeepSeek Code Harness» — равняться на Claude Code и сделать DeepSeek Code Harness. Внутреннее рабочее название — «DeepSeek Code».

Руководит командой Цуй Тяньи (崔添翼) — выпускник факультета компьютерных наук Чжэцзянского университета из поколения 90-х, обладатель шести золотых медалей азиатских региональных этапов ACM-ICPC. Он девять лет проработал в Jane Street (компании, занимающейся количественным трейдингом), затем стал сооснователем TSY Capital, а в марте 2026 года пришёл в DeepSeek. О том, насколько серьёзно DeepSeek относится к проекту, говорит планка найма: в вакансиях прямо требуется глубокое знание Claude Code, Cowork, Codex, Cursor, OpenCode, GitHub Copilot, Manus, Openclaw и Hermes.

К маю 2026 года DeepSeek опубликовала вакансии продакт-менеджера и инженера-разработчика Agent Harness; одновременно появились сообщения о новом крупном раунде финансирования (назывались суммы порядка ~51–70 млрд юаней). В июне компания заявила, что планирует примерно удвоить численность всех подразделений, а Цуй публично объявил набор на позиции Harness Researcher, Harness Engineer и Harness Product Manager, сославшись на острый дефицит кадров во всей отрасли.

Публичный дебют 31 июля

Harness оставался внутренним проектом до 31 июля 2026 года, когда был запущен официальный API DeepSeek-V4-Flash. В анонсе DeepSeek сообщила, что ключевые агентные бенчмарки V4-Flash выполнялись в DeepSeek Harness 极简模式 (минималистичном режиме) — это первое публичное признание того, что за моделями компании стоит настоящая среда исполнения агентов.

Минималистичный режим показателен: он демонстрирует, что Harness способен работать с ограниченным набором инструментов (терминал, операции с файлами, веб, выполнение кода) и всё равно показывать сильные результаты. Это ещё и осознанная продуктовая стратегия — выпустить лёгкий harness сейчас и постепенно дорабатывать его до полноценного агента «DeepSeek Code».

Результаты бенчмарков

DeepSeek опубликовала следующие агентные результаты V4-Flash в минималистичном режиме Harness:

Бенчмарк Результат Что проверяет
TerminalBench 2.1 82.7 Работа в терминале/CLI
Cybergym 76.7 Симуляция задач кибербезопасности
Toolathlon (verified) 70.3 Надёжность вызова инструментов
DSBench-FullStack 68.7 Full-stack-разработка
DSBench-Hard 59.6 Сложные задачи по программированию

Для сравнения: общий агентный балл V4-Flash у DeepSeek (~25.2) оказывается рядом с 25.7 у Claude Opus 4.8. Модель V4-Pro, с которой Harness тоже будет работать, набрала 80.6% на SWE-bench Verified — бенчмарке по программной инженерии, который де-факто стал стандартом для агентов-программистов. С такими цифрами DeepSeek — полноправный участник гонки агентов для кода, а не далёкий догоняющий.

Почему важен выбор модели: V4-Flash + Harness

В принципе Harness не привязан к конкретной модели, но его запуск в паре с V4-Flash не случаен. V4-Flash — это разреженная MoE-модель на 284B параметров, из которых активны только 13B, с контекстным окном в 1M токенов, лицензией MIT и — с 31 июля — первая модель DeepSeek с нативной поддержкой OpenAI Responses API и официальной интеграцией с Codex.

Зачем сочетать среду исполнения агентов с дешёвой моделью?

  1. Агентные циклы прожорливы по токенам. Одна реальная агентная задача может сжечь 500K+ токенов (в одном задокументированном тесте ушло ~510K токенов, что стоило ~¥0.53). С моделью, у которой выход стоит $30 за миллион, такая экономика не сходится. С V4-Flash за $0.14/$0.28 долго работающие агенты становятся финансово оправданными.
  2. Попадания в кэш почти бесплатны. При $0.0028/M за входные токены из кэша стабильный системный промпт на протяжении длинной агентной сессии практически ничего не стоит.
  3. Параллелизм. 2 500 одновременных запросов позволяют одному Harness оркестрировать множество агентов параллельно, не упираясь в лимиты запросов.

Ставка DeepSeek такова: агентный фреймворк, достаточно дешёвый, чтобы его действительно можно было запускать в масштабе. Это прямой удар по экономике Claude Code, где тяжёлые агентные сессии на флагманских моделях могут вылиться в серьёзные счета.

Как Harness управляет агентом (концептуально)

Полная версия harness «DeepSeek Code» пока не опубликована, но архитектура минималистичного режима следует стандартному агентному циклу, к которому пришла индустрия:

text
Запрос пользователя
   │
   ▼
[Планировщик]  --разбивает задачу на шаги-->  [Исполнитель]  --вызывает инструменты-->
   │                                                │  (оболочка, файлы, веб, выполнение кода)
   │                                                ▼
   │                                     [Результаты инструментов]
   │                                                │
   └──────<----- цикл, пока цель не достигнута -----┘
   │
   ▼
[Проверка завершения]  --цель достигнута или бюджет исчерпан?-->  [Итоговый ответ]

Harness решает, какие инструменты существуют, как результаты возвращаются в контекст, как порождаются субагенты и когда остановиться. Минималистичный режим держит эту поверхность небольшой: один агент, несколько инструментов, никакого разветвления на субагентов. В полной версии добавятся оркестрация субагентов, постоянная память и более развитое планирование.

Как это выглядит при запуске агентов уже сегодня

Чтобы получить ту же экономику, не обязательно ждать, пока DeepSeek доведёт полный Harness до продукта. Модель V4-Flash, вокруг которой он построен, доступна через любой OpenAI-совместимый эндпоинт — в том числе через TeamoRouter, который маршрутизирует её наряду с Claude Code, Codex и другими агентными стеками:

python
# Управляем агентом на V4-Flash через OpenAI Responses API (так же, как это делает Harness)
from openai import OpenAI

client = OpenAI(
    api_key="tr-your-key-here",
    base_url="https://api.teamorouter.com/v1",
)

resp = client.responses.create(
    model="deepseek-v4-flash",
    input=(
        "You are an autonomous coding agent. Inspect the repo at /src, "
        "find the failing test, fix the bug, run the test suite, and report. "
        "Use tools as needed and keep going until the suite passes."
    ),
)
print(resp.output_text)

Поскольку V4-Flash поддерживает OpenAI Responses API, существующие агентные фреймворки (OpenCode, OpenClaw, Cline и другие с поддержкой пользовательского base URL) можно направить на неё, изменив одну строку конфигурации:

yaml
# opencode / openclaw / cline config
provider:
  baseUrl: https://api.teamorouter.com/v1
  apiKey: tr-your-key-here
  model: deepseek-v4-flash

Конкурентный ландшафт

DeepSeek Harness выходит на плотно занятое поле:

Агентный продукт Компания Модель по умолчанию Отличительная черта
Claude Code Anthropic Claude Opus/Sonnet/Fable Глубина рассуждений, надёжность работы с инструментами
Codex OpenAI GPT-5.6 Sol/Terra/Luna Режим Fast, OAuth через ChatGPT, экосистема
DeepSeek Code (Harness) DeepSeek V4-Pro / V4-Flash Стоимость — запуск в 30–100 раз дешевле
Antigravity 2.0 Google Gemini 3.x Мультимодальность, экосистема Google

Конкурентная логика понятна. Claude Code выигрывает по чистому качеству агента; Codex — по экосистеме и скорости (режим Fast); DeepSeek — по юнит-экономике. Для команд, у которых агентные циклы крутятся круглосуточно и каждый день, решающим фактором становится разрыв в цене между агентной сессией на флагманской модели Claude и сессией на Flash — тот самый разрыв, который мы разбирали в сравнении V4 Flash и GPT-5.6 Sol.

Аналитики видят в ставке DeepSeek на Harness переход компании от чистого поставщика моделей к продуктовой компании — тот же шаг, что Anthropic сделала с Claude Code, а OpenAI — с Codex. По мере того как возможности моделей становятся массовым товаром, ценность (и защитный ров) переезжает в «слой над моделью».

За чем следить дальше

История Harness только начинается, и следить стоит за тремя вещами:

  1. Полноценный релиз «DeepSeek Code». Минималистичный режим — это плацдарм. Настоящей проверкой станет полный агентный продукт — с оркестрацией субагентов, постоянной памятью и более развитым планированием. Судя по внутренним сообщениям и вакансиям, он на подходе.
  2. Поддержка V4-Pro в Harness. Поддержку Responses API в V4-Pro ожидали в начале августа 2026 года. Когда Harness начнёт работать с V4-Pro, цифры на SWE-bench Verified (у модели там уже 80.6%) наверняка получат широкую огласку.
  3. Ценовая дисциплина в масштабе. Если DeepSeek удержит цены на V4-Flash, пока другие агенты жгут флагманские токены, разрыв в стоимости станет «убийцей категории» для агентных нагрузок с большими объёмами.

Итог

DeepSeek Harness — самый стратегически значимый ход в области агентных фреймворков за лето 2026 года: серьёзная, хорошо профинансированная команда с ясным тезисом — агенты должны быть достаточно дешёвыми, чтобы запускать их в масштабе — и публичный дебют в бенчмарках, уже сейчас близкий к переднему краю. Стоящая за ним модель (V4-Flash) доступна прямо сейчас, и агентные нагрузки того же класса можно запускать через TeamoRouter, не дожидаясь полного продукта от DeepSeek. Если вы строите агентные системы, за этим фреймворком стоит следить — а его экономику перенимать.

FAQ

DeepSeek Harness — это open source?

Среда исполнения Harness в открытый доступ не выложена. Модель V4-Flash, на которой он работает, распространяется по лицензии MIT, но полный агентный фреймворк пока остаётся внутренним (публичен только минималистичный режим, использованный для бенчмарков). Следите за продуктом «DeepSeek Code».

Как DeepSeek Harness соотносится с Claude Code?

Claude Code — зрелый, выпущенный продукт с лучшей глубиной рассуждений и надёжностью работы с инструментами. DeepSeek Harness находится на более ранней стадии, но построен на радикально более дешёвых моделях — преимущество в «экономике исполнения» и есть его главное отличие.

Можно ли использовать агентов на DeepSeek V4-Flash уже сегодня?

Да. V4-Flash поддерживает OpenAI Responses API и официальную интеграцию с Codex. Любой OpenAI-совместимый агентный фреймворк можно направить на неё через TeamoRouter (https://api.teamorouter.com/v1), изменив одну строку конфигурации.

Что такое «минималистичный режим»?

Это ограниченный набор инструментов, с которым DeepSeek прогоняла агентные бенчмарки V4-Flash (терминал, файловый ввод-вывод, веб, выполнение кода), — намеренно облегчённая версия полного Harness, выпущенная первой, чтобы доказать агентные способности модели.

Будет ли DeepSeek Harness поддерживать другие модели?

В принципе да — harness не зависит от модели. На практике приоритет у собственного семейства V4 от DeepSeek, а TeamoRouter умеет маршрутизировать нагрузки в стиле Harness между Claude, GPT, Gemini и DeepSeek с одного ключа.

Готовы подключиться?Войдите в консоль, пополните баланс и создайте API-ключ.
DeepSeek Harness: подробный разбор нового агентного фреймворка · TeamoRouter