Последнее обновление: 2026-09-07 — GPT-6 Astra вышла 3 сентября 2026 года. Теперь в статье разобраны опубликованная таблица бенчмарков и возражения независимых оценщиков, а то, что было верно до релиза, оставлено как контекст.
Краткий ответ
В стартовой таблице GPT-6 Astra значатся ARC-AGI-3 на уровне под 100% (~98.6–99.9%), ~72.6% в OSWorld по управлению компьютером, 74.1% в DeepSWE v1.1 и заявленная точность ~68% на длинных агентных задачах. Но необычно большая доля этих цифр — данные самого вендора, а независимые оценщики — Artificial Analysis, Vellum и обсуждения на Reddit — показывают неоднозначные результаты в программировании по сравнению с Claude Fable 5.1 и Opus 5. Воспринимайте официальную таблицу как потолок, а не как окончательный вердикт.
Что у нас есть (математика с формальной верификацией)
Первая презентация 1 августа 2026 года опиралась не на рейтинговую таблицу, а на доказательства:
- 10 математических задач, ранее считавшихся задачами человеческого уровня, решены примерно за ~$2 000 в токенах каждая.
- Каждое доказательство проверено в Lean 4 — системе формальной проверки доказательств: его можно проверить механически и нельзя подделать.
Эта часть результатов остаётся в силе: формальную верификацию не обмануть ни загрязнением данных, ни заучиванием.
Результаты, опубликованные после релиза
По таблицам из анонса OpenAI и сторонним публикациям:
| Бенчмарк | GPT-6 Astra | Сравнение | Качество источника |
|---|---|---|---|
| ARC-AGI-3 | ~98.6–99.9% | 87.8% (Claude Fable 5.1) | Данные вендора |
| DeepSWE v1.1 (агентное программирование) | 74.1% | 72.7% (GPT-5.6 Sol) | Данные вендора |
| OSWorld (управление компьютером) | ~72.6% | прежний фронтир ~70-72% | Сторонние источники (MarkTechPost и др.) |
| ExploitBench | 100% | 78.5% (Sol), 70% (Opus 5) | Данные вендора |
| ExploitGym | 42.4% | 30.3% (Sol) | Данные вендора |
| Точность на длинных агентных задачах | ~68% | +10 п. п. ко 2-му месту | Данные вендора |
Бросаются в глаза две вещи. Во-первых, отрыв Astra больше всего именно там, где независимая проверка сложнее всего (ARC-AGI-3, ExploitBench), и меньше всего там, где практики могут проверять его ежедневно (агентное программирование). Во-вторых, цифры ExploitBench/ExploitGym — это одновременно и заявление о возможностях в кибербезопасности: тех самых возможностях, за которые модель ещё до релиза получила рейтинг Critical.
Возражения независимых оценщиков
- Artificial Analysis опубликовала и обзор запуска, и оценку, где отмечается, что Astra стоит на ~75% дороже GPT-5.6 Sol (по смешанной цене), и ставится под сомнение соотношение цены и качества: в пересчёте на один балл бенчмарка это самая дорогая модель OpenAI на сегодня.
- Vellum отмечает, что Astra лидирует «в таблице OpenAI» — формулировка важная: часть цифр пока не удалось воспроизвести независимо.
- В обсуждениях на Reddit (r/OpenAI и других) утверждают, что на реальных задачах по коду Astra «на самом деле отстаёт от Fable и даже от Opus», — это частные наблюдения, но они согласуются с описанной выше картиной.
Всё это не значит, что результаты поддельные. Это значит, что честное прочтение такое: Astra — безусловно самая сильная модель OpenAI; самая ли она сильная вообще, зависит от того, какому бенчмарку — и чьему прогону — вы доверяете.
Какие цифры действительно важны
Для большинства решений разработчика таблицу стоит ранжировать так:
- Стоимость решённой задачи, а не токена. Цены Astra $10/$50 плюс надбавка за длинный контекст после ~272K входных токенов означают, что двукратный выигрыш в качестве всё равно может обернуться пятикратным проигрышем в стоимости на потоковых задачах.
- Ваш собственный репозиторий. Разница в бенчмарках агентного программирования (DeepSWE: 74.1% против 72.7% у Sol) на реальных кодовых базах укладывается в шум между прогонами. Единственный бенчмарк, который важен для вашего рабочего процесса, — ваш набор задач.
- Управление компьютером, если это ваш сценарий. ~72.6% в OSWorld — настоящий, заметный на практике отрыв: автоматизация рабочего стола — та область, где преимущество Astra оспорить труднее всего.
- Экономика кэша. Чтение из кэша по $1.00/M против $10 за свежий ввод означает, что в агентных циклах со стабильными системными промптами реальные расходы сильно отличаются от того, что следует из заявленной цены.
Как оценить Astra самостоятельно
Не верьте маркетингу — в том числе нашему:
- Ваш собственный репозиторий — 10-20 показательных задач, каждую запустите дважды.
- A/B-сравнение с вашей текущей моделью — те же задачи, сравните качество результата и стоимость.
- С поправкой на стоимость — прирост качества на 10% не стоит цены в 2 с лишним раза выше на потоковых задачах.
Практичная схема — мультимодельный шлюз, где можно переключаться между Astra и более дешёвыми моделями под каждую задачу:
from openai import OpenAI
client = OpenAI(api_key="sk-teamo-xxxxxx", base_url="https://api.teamorouter.com/v1")
# try model="gpt-6-astra" vs "deepseek-v4-pro" / "claude-fable-5-1" on the same task
FAQ
В: Какой лучший результат GPT-6 Astra в бенчмарках? Главные цифры — ARC-AGI-3 на уровне ~98.6–99.9% (данные вендора) и ~72.6% в OSWorld по управлению компьютером (подтверждено сторонними источниками). А самым защищённым от подтасовок достижением остаются математические доказательства — 10 задач, проверенных в Lean 4, с августовской презентации.
В: Astra лучше, чем Claude Fable 5.1? По таблице OpenAI — да (98.6%+ против 87.8% в ARC-AGI-3). По независимым впечатлениям от работы с кодом вопрос спорный: ряд оценщиков и обсуждений среди практиков ставят Fable 5.1 выше на реальных задачах разработки. Сравнение на уровне принятия решений — в статье Fable 5.1 vs GPT-6 Astra.
В: Почему говорят, что бенчмарки оспариваются? Потому что большая доля цифр — данные вендора, независимые перепрогоны показывают неоднозначные результаты в программировании по сравнению с Fable 5.1 и Opus 5, а из-за цены картина «баллы на доллар» выглядит хуже, чем можно подумать по исходной таблице.
В: За чем следить после релиза? За независимыми воспроизведениями в духе SWE, стоимостью задачи (а не токена) и реальной производительностью в мультиагентных сценариях — плюс за тестами на собственном репозитории.
Итоги
Опубликованная таблица Astra впечатляет и частично подтверждена: формально проверенная математика, реальный отрыв в управлении компьютером и сильные агентные цифры, которые пока воспроизведены не полностью. Оценивайте модель на собственных задачах и маршрутизируйте запросы по типу задачи, чтобы расходы оставались разумными. Зарегистрируйтесь в TeamoRouter, чтобы сравнить Astra с Fable 5.1 и более дешёвыми моделями в A/B-тесте на одном ключе.
С чего начать
TeamoRouter — переключайтесь между Astra, Claude и более дешёвыми моделями на одной и той же задаче, с одним ключом.