Блог

Бенчмарки GPT-6 Astra: что известно на данный момент

Последнее обновление: 2026-09-07 — GPT-6 Astra вышла 3 сентября 2026 года. Теперь в статье разобраны опубликованная таблица бенчмарков и возражения независимых оценщиков, а то, что было верно до релиза, оставлено как контекст.

Краткий ответ

В стартовой таблице GPT-6 Astra значатся ARC-AGI-3 на уровне под 100% (~98.6–99.9%), ~72.6% в OSWorld по управлению компьютером, 74.1% в DeepSWE v1.1 и заявленная точность ~68% на длинных агентных задачах. Но необычно большая доля этих цифр — данные самого вендора, а независимые оценщики — Artificial Analysis, Vellum и обсуждения на Reddit — показывают неоднозначные результаты в программировании по сравнению с Claude Fable 5.1 и Opus 5. Воспринимайте официальную таблицу как потолок, а не как окончательный вердикт.

Что у нас есть (математика с формальной верификацией)

Первая презентация 1 августа 2026 года опиралась не на рейтинговую таблицу, а на доказательства:

  • 10 математических задач, ранее считавшихся задачами человеческого уровня, решены примерно за ~$2 000 в токенах каждая.
  • Каждое доказательство проверено в Lean 4 — системе формальной проверки доказательств: его можно проверить механически и нельзя подделать.

Эта часть результатов остаётся в силе: формальную верификацию не обмануть ни загрязнением данных, ни заучиванием.

Результаты, опубликованные после релиза

По таблицам из анонса OpenAI и сторонним публикациям:

Бенчмарк GPT-6 Astra Сравнение Качество источника
ARC-AGI-3 ~98.6–99.9% 87.8% (Claude Fable 5.1) Данные вендора
DeepSWE v1.1 (агентное программирование) 74.1% 72.7% (GPT-5.6 Sol) Данные вендора
OSWorld (управление компьютером) ~72.6% прежний фронтир ~70-72% Сторонние источники (MarkTechPost и др.)
ExploitBench 100% 78.5% (Sol), 70% (Opus 5) Данные вендора
ExploitGym 42.4% 30.3% (Sol) Данные вендора
Точность на длинных агентных задачах ~68% +10 п. п. ко 2-му месту Данные вендора

Бросаются в глаза две вещи. Во-первых, отрыв Astra больше всего именно там, где независимая проверка сложнее всего (ARC-AGI-3, ExploitBench), и меньше всего там, где практики могут проверять его ежедневно (агентное программирование). Во-вторых, цифры ExploitBench/ExploitGym — это одновременно и заявление о возможностях в кибербезопасности: тех самых возможностях, за которые модель ещё до релиза получила рейтинг Critical.

Возражения независимых оценщиков

  • Artificial Analysis опубликовала и обзор запуска, и оценку, где отмечается, что Astra стоит на ~75% дороже GPT-5.6 Sol (по смешанной цене), и ставится под сомнение соотношение цены и качества: в пересчёте на один балл бенчмарка это самая дорогая модель OpenAI на сегодня.
  • Vellum отмечает, что Astra лидирует «в таблице OpenAI» — формулировка важная: часть цифр пока не удалось воспроизвести независимо.
  • В обсуждениях на Reddit (r/OpenAI и других) утверждают, что на реальных задачах по коду Astra «на самом деле отстаёт от Fable и даже от Opus», — это частные наблюдения, но они согласуются с описанной выше картиной.

Всё это не значит, что результаты поддельные. Это значит, что честное прочтение такое: Astra — безусловно самая сильная модель OpenAI; самая ли она сильная вообще, зависит от того, какому бенчмарку — и чьему прогону — вы доверяете.

Какие цифры действительно важны

Для большинства решений разработчика таблицу стоит ранжировать так:

  1. Стоимость решённой задачи, а не токена. Цены Astra $10/$50 плюс надбавка за длинный контекст после ~272K входных токенов означают, что двукратный выигрыш в качестве всё равно может обернуться пятикратным проигрышем в стоимости на потоковых задачах.
  2. Ваш собственный репозиторий. Разница в бенчмарках агентного программирования (DeepSWE: 74.1% против 72.7% у Sol) на реальных кодовых базах укладывается в шум между прогонами. Единственный бенчмарк, который важен для вашего рабочего процесса, — ваш набор задач.
  3. Управление компьютером, если это ваш сценарий. ~72.6% в OSWorld — настоящий, заметный на практике отрыв: автоматизация рабочего стола — та область, где преимущество Astra оспорить труднее всего.
  4. Экономика кэша. Чтение из кэша по $1.00/M против $10 за свежий ввод означает, что в агентных циклах со стабильными системными промптами реальные расходы сильно отличаются от того, что следует из заявленной цены.

Как оценить Astra самостоятельно

Не верьте маркетингу — в том числе нашему:

  1. Ваш собственный репозиторий — 10-20 показательных задач, каждую запустите дважды.
  2. A/B-сравнение с вашей текущей моделью — те же задачи, сравните качество результата и стоимость.
  3. С поправкой на стоимость — прирост качества на 10% не стоит цены в 2 с лишним раза выше на потоковых задачах.

Практичная схема — мультимодельный шлюз, где можно переключаться между Astra и более дешёвыми моделями под каждую задачу:

python
from openai import OpenAI
client = OpenAI(api_key="sk-teamo-xxxxxx", base_url="https://api.teamorouter.com/v1")
# try model="gpt-6-astra" vs "deepseek-v4-pro" / "claude-fable-5-1" on the same task

FAQ

В: Какой лучший результат GPT-6 Astra в бенчмарках? Главные цифры — ARC-AGI-3 на уровне ~98.6–99.9% (данные вендора) и ~72.6% в OSWorld по управлению компьютером (подтверждено сторонними источниками). А самым защищённым от подтасовок достижением остаются математические доказательства — 10 задач, проверенных в Lean 4, с августовской презентации.

В: Astra лучше, чем Claude Fable 5.1? По таблице OpenAI — да (98.6%+ против 87.8% в ARC-AGI-3). По независимым впечатлениям от работы с кодом вопрос спорный: ряд оценщиков и обсуждений среди практиков ставят Fable 5.1 выше на реальных задачах разработки. Сравнение на уровне принятия решений — в статье Fable 5.1 vs GPT-6 Astra.

В: Почему говорят, что бенчмарки оспариваются? Потому что большая доля цифр — данные вендора, независимые перепрогоны показывают неоднозначные результаты в программировании по сравнению с Fable 5.1 и Opus 5, а из-за цены картина «баллы на доллар» выглядит хуже, чем можно подумать по исходной таблице.

В: За чем следить после релиза? За независимыми воспроизведениями в духе SWE, стоимостью задачи (а не токена) и реальной производительностью в мультиагентных сценариях — плюс за тестами на собственном репозитории.

Итоги

Опубликованная таблица Astra впечатляет и частично подтверждена: формально проверенная математика, реальный отрыв в управлении компьютером и сильные агентные цифры, которые пока воспроизведены не полностью. Оценивайте модель на собственных задачах и маршрутизируйте запросы по типу задачи, чтобы расходы оставались разумными. Зарегистрируйтесь в TeamoRouter, чтобы сравнить Astra с Fable 5.1 и более дешёвыми моделями в A/B-тесте на одном ключе.

С чего начать

TeamoRouter — переключайтесь между Astra, Claude и более дешёвыми моделями на одной и той же задаче, с одним ключом.

Готовы подключиться?Войдите в консоль, пополните баланс и создайте API-ключ.
Бенчмарки GPT-6 Astra: что известно на данный момент · TeamoRouter