首页> 新闻>  正文
他把草稿存进 Codex,然后 OpenAI 宣称解出了千禧年难题
来源:赛迪网     作者: 2026-09-10 15:21:59
微信分享二维码

扫码分享到微信

关闭

9月5日,周六。OpenAI 的约一万个 AI 智能体跑满第 88 个小时,解出了纳维-斯托克斯方程。那是克雷数学研究所 2000 年挂出的七个千禧年难题之一,悬赏一百万美元,二十六年没人碰下来。

消息没有马上公布。三天后,OpenAI 才把证明全文挂上官网。而就在官宣前一天,纽约大学数学教授 Tristan Buckmaster 先出了一招,把一篇连他自己都嫌粗糙的论文匆匆挂上网。那是他和合作者一年的心血。写作期间所有的草稿,都存在 OpenAI 自家工具 Codex 的会话记录里。

一场突破,两种画风。一边是"史诗时刻",一边是连夜出牌。这一周 AI 在数学上连下两城——OpenAI 解出 NS 方程,Anthropic 用 11 天把费马大定理变成机器可验的代码。但被庆祝声盖住的,是另一件事:AI 已经能把证明造出来,数学界却没有任何一套机制能把它认下来。而最先被这套机制卡住的,是每一个把草稿喂给 AI 的人。

先说好消息

Anthropic 的那条先落地。9月4日,他们宣布 Claude 用 11 天,把怀尔斯 1995 年的费马大定理证明整个搬进了 Lean——一种计算机能逐行核验的证明语言。1300 万行代码,三万多个定理,只依赖 Lean 的三条标准公理。怀尔斯的原版证明印出来 129 页,当年一组数学家查了几个月,查出一个漏洞,又补了一年才补上。

这份新证明,机器复核要多久?22 个小时,外加约 300GB 内存。伦敦帝国学院的 Kevin Buzzard 是 2024 年"人工形式化费马"社区项目的发起人,原本估计这活要干十年。他在 Anthropic 的公告里给了句话。过去他对这份证明"99.9% 确定",现在是 100%。

三天后,轮到 OpenAI。9月8日,官博宣布,一个内部模型驱动约一万个智能体,用 88 小时给出了纳维-斯托克斯"有限时间爆破"的完整证明。这个模型的能力显著超过 GPT-6 Astra。所谓有限时间爆破,是指一段从静止出发、受光滑外力、能量始终有限的流体,会在有限时间内出现速度无界的点。物理图像是个涡旋,越转越快、越卷越紧,但总能量不超限。165 页证明全文和 Lean 形式化代码一起公开。OpenAI 顺手声明,那一百万美元不要了。奥特曼在 X 上说,看着这件事发生,是"OpenAI 历史上最令人惊叹的时刻之一"。

如果故事到这里为止,这就是 AI 该有的样子:难题排队,AI 逐个清场。

数学家为什么没睡好

Buckmaster 没在庆祝。他和 Levent Alpöge 的合作已经进行约一年。Alpöge 在 Anthropic 任职,但这是纯私人合作,跟两家公司都没有关系。两人攻的是"受迫爆破",就是给流体施加一个光滑的外力,看它会不会在有限时间内炸出无穷大的速度。这条路线的原创者是数学家 Diego Córdoba 和 Luis Martínez-Zoroa,Buckmaster 在声明里专门把功劳还回去,甚至说 Martínez-Zoroa 该拿菲尔兹奖。大模型在这条路线里只管干活。Claude 和 Codex 打主力,所有草稿存进 Codex 的会话。

8月15日,两人拿下受迫情形的爆破结果,一周后过了 Lean 验证。按原计划,接下来该花几周把证明打磨成体面的论文。

9月1日,OpenAI 听到一个传闻,说 Anthropic 可能解出了某个重大开放问题。内部模型随即被放出去,对六个悬而未决的千禧难题做了轮评估。9月3日,Buckmaster 主动给一位 OpenAI 的数学家写邮件,把传言挑明:这不是机构项目,是我们俩的,成果马上发。他还特意交代,小组用的 AI 工具全是自费,"包括给 OpenAI 付的一大笔账单"。对方当天回复:愿意提供算力,"避免竞争"。

9月6日,周日。OpenAI 把会约到了当天,研究员 Sébastien Bubeck 加入。他被告知:OpenAI 的内部模型解出了受迫情形的纳维-斯托克斯爆破,证明约一百页。对方起初说,模型"几乎没靠人类"——然后这个说法在通话里当着他的面一层层塌掉:其实有一整个团队;试过很多方向;先让模型在欧拉上练过手;连展示给他的那段提示词,都是先让 Codex 写出来的。他问,你们第一次发提示是什么时候?绕了几圈,答案是:几天前——在我们工作的消息传到 OpenAI 之后。

他还问了一个最要命的问题:模型训练过、或者读过我们在 Codex 里的会话吗?得到的回答是,模型不会去查用户数据。他追问训练。没有回答。

然后是两个方案。其一,两人先发欧拉论文,OpenAI 次日发 NS 结果;其二,由他单独署名一篇介绍 OpenAI 证明的论文。Bubeck 两次提出,这篇论文不要署 Alpöge——因为他在 Anthropic 任职。Buckmaster 都拒了,说自己会把经过公开。对方的回应是:"你为什么要毁掉自己的职业生涯?"他答,我是学者,这怎么会毁了我?对方说:"如果你不想让我客气,我可以不客气。"

9月7日,两人把三篇论文连同四页声明全部公开。Buckmaster 在声明里为论文质量道歉,称这份仓促赶出来的证明"只能被称为 AI slop",本该花几周打磨。他同时把边界划清:我没看过 OpenAI 的证明,不知道他们的模型做了什么,不知道我们的数据是否被使用,"我不指控任何人"。

OpenAI 的回应随后到:指控"虚假且具煽动性"。Bubeck 为那句话道歉,称"极其糟糕的措辞,当场就收回了",并放出短信截图,说明自己曾主动提出公开全部提示词、承认两人的优先权。

OpenAI 冤不冤

把双方说法摆在一起,OpenAI 没那么不堪。官博给了四项澄清:两人公开成果前,研究人员和智能体没有通过任何方式看到其工作;没有为解这道题访问特定用户数据;两人在受迫欧拉上的优先权"我们予以承认,并表示祝贺";双方证明显著不同,连欧拉部分都不是同一个问题——一个受迫,一个无外力。

那句署名公案也有另一面。澎湃新闻的梳理指出,两句话可能根本不指向同一篇论文。Bubeck 的原话是"从未要求把他从自己的工作上移除"。他说的是 Alpöge 参与的欧拉论文。Buckmaster 说的"移除署名",指那篇新论文,由他执笔,改写 OpenAI 的证明。字面上未必矛盾。但效果是一致的。合作一年的 Alpöge,被从成果链条里择了出去。

数据的事,OpenAI 首席研究官 Mark Chen 说得更直白:我们确实用用户反馈和去标识化数据整体改进 ChatGPT 和 Codex,"每家 LLM 公司都这样"。

规则空白在哪

目前没有证据表明 OpenAI 动过那两份草稿。真正值得盯住的,是 OpenAI 自己写下的那句话。官博原文:虽然可能性不大,"我们无法排除两人使用我们产品所产生的去标识化衍生数据,帮助改进了我们的模型"。

去标识化,就是抹掉账号和姓名;衍生数据,是从原始内容再加工出来的东西。处理完,看不出是谁写的,但字里的数学思路还在。Buckmaster 在电话里没得到回答的那个问题,公告用四个字作了答:无法排除。

这是个付费客户的未发表草稿。而在主流大模型的服务条款里,你输入的内容,本来就在"可用于改进服务"的范围之内。想想自己:没写完的方案,改到一半的代码,只敢存进备忘录的点子。这些东西,有多少已经躺在某家公司的训练管线里?Buckmaster 的遭遇只是同一件事的放大版。一年的智力积累,可能成了别人模型的养料;而他在电话里,连一个干脆的"没有"都没换到。

把一切都交给机器验证,行不行?费马那个案例看起来支持:1300 万行代码,机器 22 小时复核完毕,确定性从 99.9% 拉满到 100%。但承认和验证是两回事。克雷研究所的规则写着:解法先在正规期刊发表,再被数学界接受满两年,委员会才开会审议。所长 Bridson 对法新社说,评估"刻意不慌不忙"。数学界对"接受"这件事一贯很慢:怀尔斯的证明被审出漏洞后补了一年;开普勒猜想的计算机证明审了四年,审查组只敢说"99% 确定";佩雷尔曼的庞加莱猜想,被消化用了大约四年。

Lean 没有取消这个流程,它只是把信任的门槛从"读得懂"换成"跑得过"。而"跑得过"的门槛,是 300GB 内存,和一屋子会读 Lean 的人。信任没有消失,只是换了把门的。连 Buckmaster 自己都把赶工发出的证明叫"AI slop"——生成可以一万个智能体并行,读懂,一个都慢。

陶哲轩看到的是更远的一层。争议发酵那两天,他发了四段长文,核心一句:哪怕只是传闻,都足以触发大规模 AI 算力,在原研究项目成熟之前将其碾平。当"听到风声就压上算力"成为理性策略,数学家的理性反应就是藏方向、晚分享、少说话。开放科学几百年的习惯,正在被重新定价。

最后

克雷研究所的流程才刚走完第一步。按规则,OpenAI 的证明要先过同行评审,再被数学界接受满两年,委员会才会开会审议。最快,也是两年后的事。

Buckmaster 和 Alpöge 的欧拉证明倒是已经过了机器验证。至于下一个项目的草稿还存不存进 Codex,声明里没写。但换你,你还存吗?(文/王子祺)

Arm Eddie Ramirez:深耕中国云AI生态,双架构协同、全矩阵布...

从阿里云倚天710规模化商用,到众多初创企业、头部科技企业布局Arm架构数据中心芯片、DPU与边缘算力产品…

4小时前
没有了
你可能也喜欢这些文章