一句话结论
OpenAI 用一篇 249 页论文 首次披露 GPT-6 Astra,方式是展示它解出 10 道此前人类级别难度的数学难题,每道平均约 $2000 token 成本,结果由 Lean 4 证明器做了形式化验证。这件事的意义不在于「会做数学题」,而在于它改变了 AI 能力的评估方式:从晒 benchmark 分数,转向晒可形式化验证的证明。
这 10 道题是什么
论文没有公开完整的 10 道题清单,但已知的关键信息是:
- 难度定位为「此前被认为是人类级别、需要深度推理才能解决」的数学问题;
- 不是选择题或填空,而是需要构造性证明的开放题;
- 每道题平均消耗约 $2000 的 token 成本——意味着模型内部经历了极长的推理链。
这个成本数据本身就是信息:旗舰级深度推理是极其昂贵的,单题 $2000 的量级,决定了它不可能用于日常任务。
Lean 4 验证为什么重要
传统的「模型做对题」可以靠背答案、蒙、或训练数据泄露来造假。Lean 4 是形式化证明器,模型给出的证明必须能被机械地、逐行地验证为逻辑严密,才算通过。这意味着:
- 结果不可伪造:证明要么形式化成立,要么不成立,没有「蒙对」的空间;
- 能力是「推理」而非「记忆」:能产出 Lean 4 可验证的构造性证明,说明是真正的推导,不是检索;
- 评估范式升级:以后「强不强」可能不再看 GLUE/SWE-bench 分数,而是看「能不能给出形式化验证的证明」。
这也是为什么这次亮相能引发这么大震动——它不是又一张 benchmark 榜单,而是「机器给出了可验证的数学证明」。
但也别过度解读
有几个需要冷静的地方:
- 10 道题 ≠ 通用强:数学强不代表编程强、不代表多模态强,能力是分维度的;
- 官方没公开题目全貌:我们只知道「10 道、难、$2000、Lean 4 验证」这些关键词,具体题目和难度有待发布后核实;
- 成本是硬约束:$2000 一题的现实,意味着 Astra 的旗舰推理注定是「关键时刻才用」的资源。
常见疑问
Q:Lean 4 验证能证明模型「理解」数学吗? 它证明的是「给出的证明逻辑严密」,不直接等价于「人类意义上的理解」。但形式化验证是目前最硬的、无法作假的正确性证据,比 benchmark 分数可信得多。
Q:$2000 一题,普通开发者用得起吗? 用不起,也不该用。这恰恰说明 Astra 的旗舰推理是「稀缺资源」,日常任务该路由到便宜模型,只在关键推理上开 Astra。
Q:这对编程能力意味着什么? 间接利好——能产出严密证明的模型,通常也能做严格的多步推理。但编程没有 Lean 4 这种「可验证」背书,还是要等实际的 SWE 类 benchmark。
总结
GPT-6 Astra 的「10 道数学难题」是它目前唯一、也是最硬的亮相证据:可形式化验证的深度推理,以及 $2000 一题的昂贵成本。它定义了下一代旗舰的样子——强,但贵,且只在关键时刻值得用。注册 TeamoRouter,等 Astra 上线后把这种「稀缺推理」精准花在刀刃上。