OpenAI本周公开了数百份AI生成的数学难题解答,声称覆盖了一批世界级开放问题。但数学界的反应并不积极。
据TechCrunch报道,OpenAI这次发布前,曾表示已咨询由顶尖数学家组成的顾问小组,希望避免重演此前AI解决长期数学难题时引发的争议。从目前结果看,OpenAI并没有完全达到数学界希望看到的标准。
这个顾问小组名为AGMAI,由普林斯顿高等研究院承办,成员包括全球多家机构的9位知名数学研究者。9月底,AGMAI刚发布一套面向前沿AI实验室的数学问题解决指南,其中第一条建议就很直接:停止用专有模型测试高级数学问题。
但OpenAI此次发布明确写道,它正在用数学开放研究问题评估自家专有模型。也就是说,它一开始就踩在了顾问小组最敏感的边界上。
OpenAI确实遵循了部分建议,例如尽快公开结果,并提供模型如何得出结论的信息。但此次719份手稿中,只有10份公开了模型的chain of thought。对于人类尚不能充分理解的论文,AGMAI建议应进行形式化验证,但OpenAI发布的证明并未全部完成这一过程。
其中核心的问题是,数学不是只要答案看起来对就够了。
AGMAI强调,前沿实验室在发布AI证明时,应承担责任,确保人类能够理解这些结果。因为数学成果真正有价值,不只是证明某个结论成立,还包括人类数学家能解释它、讨论它、在讲座和论文中回应质疑,并把其中方法推广到其他问题。
著名数学家陶哲轩也批评了这种做法。他认为,现在一些AI提示者让模型自动解题,目标一旦被标记为“解决”,他们就不再关心这个领域,也没有足够理解AI输出,无法回答问题、做报告,或与数学共同体正常互动。
本周,剑桥大学和伦敦国王学院数学家发布了一篇论文,质疑前沿AI实验室处理数学问题的方式。论文指出,AI模型通常先生成一份自然语言证明,再尝试把它翻译成Lean代码。但问题出在翻译环节。OpenAI针对一个源自Navier Stokes方程的问题所给出的解答中,自然语言证明和Lean代码之间至少存在两处不一致。
这些不一致说明,不能简单相信模型可以自己把自然语言证明可靠地转换成形式化代码。
对OpenAI来说,这些结果展示了模型在高级推理上的突破。对数学家来说,这些证明还只是工作开始的地方。
当AI声称解出数学难题时,谁来理解它,谁来解释它,谁来为它负责。数学界显然还没有准备好把这个责任交给模型自己。