OpenAI 以一种不太寻常的方式预告了它的下一代模型家族Astra:直接公布它在10道长年未解的数学与理论计算机科学难题上做出的成果。据OpenAI 研究员Noam Brown 于8月1日发布的信息,一个内部版本的Astra 对这10个问题给出了答案,而这些问题至少十年、多数更久都没有人取得进展。这是AI在科学推理上的一大步,但也有几个必须先讲清楚的但书。
这些问题横跨高维几何、编码理论、群论、量子复杂度、格密码学与极值组合等领域。其中几个具指标性:一是解决了群论里「非索菲群(non-sofic groups)是否存在」这个重大的未解问题;二是Erdős 早在1946 年提出的「平面单位距离问题」相关进展;理论计算机科学方面,也包含计算矩阵permanent 的新电路复杂度下界。 Astra 被定位为「长时推理」模型,能协调多个智能体,在数小时到数天的尺度上处理复杂问题—这正是攻这类难题所需的持久推理能力。
这里的分工方式是关键。 OpenAI 表示,数学论证本身「来自Astra」,人类研究员则协助把结果整理成论文、并将证明形式化。关键在于最后这一步:每个解答都被写成形式化证明语言Lean 的证书,也就是「机器可检验的正确性凭证」。这一点很重要—它意味着这些证明的逻辑正确性不是靠人相信AI,而是能由电脑逐步验证。成本方面,OpenAI 称以其Sol 模型的API 费率换算,这些解答的token 成本约在2,000 美元等级,并强调每题花费其实不高,算力还能再往上加。
几个但书要放在一起看。第一,这是Astra 的「内部、未发布」版本,不是公开可用的模型,Noam Brown 也明讲是internal version。第二,Lean 能验证证明的「逻辑正确性」,但一个结果在数学界的「重要性与新颖性」仍要经过同行评审与时间检验,这部分尚未完成。第三,Noam Brown 主动点出限制:他们试过其他更大的问题但没成功,也还没解出任何「千禧年大奖难题」。即便如此,外部数学家已给出正面评价—Thomas Bloom 称这是「大新闻」。把这几点合起来,比较准确的说法是:AI 首次在多个长年未解的真问题上,以可机器验证的方式做出贡献,这是研究级推理的一个实质里程碑,而不是「数学被AI 解完了」。这也延续了近期AI 开始能做研究级数学与密码分析的趋势。