Блог

10 математических задач GPT-6 Astra: история про $2 000 и Lean 4

Короткий ответ

OpenAI впервые показала GPT-6 Astra не таблицей бенчмарков, а статьёй на 249 страниц: в ней модель решила 10 математических задач, которые раньше считались задачами человеческого уровня сложности, потратив примерно $2 000 в токенах на каждую, причём каждое доказательство формально проверено системой доказательств Lean 4. Значимость не в том, что «модель умеет в математику», а в том, что оценка ИИ смещается от баллов в бенчмарках к формально проверяемым доказательствам.

Что известно об этих 10 задачах

  • Полный список задач не опубликован; формулировка такая: «сложные задачи, прежде доступные только человеку и требующие глубоких рассуждений».
  • Это не тесты с выбором ответа — они требуют конструктивных доказательств.
  • Каждая обошлась в среднем примерно в $2 000 токенами, что говорит о чрезвычайно длинных внутренних цепочках рассуждений.

Эта цифра сама по себе информативна: фронтирные глубокие рассуждения невероятно дороги — настолько, что для повседневных задач они не подходят.

Почему важна верификация в Lean 4

Традиционное «модель ответила правильно» можно обыграть за счёт заучивания, угадывания или утечки обучающих данных. Lean 4 — это система формальных доказательств: доказательство модели засчитывается, только если его логическую корректность можно механически проверить строка за строкой. Это означает:

  1. Результат нельзя подделать — доказательство либо проходит формальную проверку, либо нет; «удачных догадок» не бывает.
  2. Это рассуждение, а не припоминание — конструктивное доказательство, проверяемое в Lean 4, демонстрирует настоящий вывод, а не извлечение из памяти.
  3. Новый стандарт оценки — возможно, уже скоро «насколько модель сильна» будут измерять вопросом «может ли она выдавать формально проверенные доказательства», а не баллами GLUE/SWE-bench.

Вот почему эта презентация весит больше очередной таблицы лидеров: это история о том, что «машина выдала проверяемое математическое доказательство». (Впервые слышите о самой модели? Вводная — в статье Что такое GPT-6 Astra.)

Не делайте слишком далёких выводов

  • 10 задач ≠ сила во всём — сила в математике не означает силы в коде или мультимодальности; возможности оцениваются по каждому измерению отдельно (см. что данные бенчмарков покрывают, а что нет).
  • Полный набор задач не опубликован — мы знаем «10 штук, сложные, $2 000, проверены в Lean 4», но не сами задачи.
  • Стоимость — жёсткое ограничение — $2 000 за задачу означает, что флагманские рассуждения — ресурс «только для критических моментов» (анализ цен GPT-6 Astra).

FAQ

В: Доказывает ли верификация в Lean 4, что модель «понимает» математику? Она доказывает, что данное доказательство логически корректно, — но не «понимание по-человечески». При этом формальная верификация — самое строгое и не поддающееся подделке свидетельство корректности из доступных, и доверия к ней гораздо больше, чем к баллу в бенчмарке.

В: При цене $2 000 за задачу — могут ли этим пользоваться обычные разработчики? Нет, и не нужно. Это лишь подтверждает, что флагманские рассуждения — дефицитный ресурс: повседневные задачи направляйте на дешёвые модели, а Astra приберегите для критически важных рассуждений.

В: Что это значит для программирования? Косвенно — хороший знак: модель, которая выдаёт строгие доказательства, обычно справляется и со строгими многошаговыми рассуждениями. Но у кода нет верификатора в духе Lean 4, а результаты в программировании, опубликованные после релиза 3 сентября 2026 года (74.1% в DeepSWE v1.1 против 72.7% у GPT-5.6 Sol), — это данные вендора при неоднозначных независимых оценках, так что проверяйте модель на собственном репозитории.

Итоги

«10 математических задач» GPT-6 Astra были единственным публичным свидетельством её возможностей до релиза 3 сентября 2026 года и остаются самым весомым: формально проверяемые глубокие рассуждения примерно по $2 000 за задачу. Оно задало образ флагмана, который теперь вышел с ценой $10/$50 за миллион токенов: сильный, но дорогой — использовать его стоит только там, где это действительно важно. Зарегистрируйтесь в TeamoRouter, чтобы тратить этот дефицитный ресурс рассуждений точно там, где он нужен.

С чего начать

TeamoRouter — критически важные рассуждения направляйте на Astra, всё остальное — на модели подешевле, и всё это с одним ключом.

Готовы подключиться?Войдите в консоль, пополните баланс и создайте API-ключ.
10 математических задач GPT-6 Astra: история про $2 000 и Lean 4 · TeamoRouter