上周五,HN 首页挂了一条数学新闻。前脚 OpenAI 刚官宣自家模型独立证出的新结果,后脚就有人在 r/math 晒出了这个:GPT-5.6 用一条 prompt,补上了凸优化三十年的缺口。
事情本身三句话能说完。三十年前,有人发表了一个凸优化算法。三十年里,没人知道它是不是最优的——会不会哪天冒出一个更快的解法,谁也证不掉。上周,有人用 GPT-5.6 把这件事证死了:不会有了。这类问题上任何算法至少要做 Ω(d²) 次函数求值,跟那个老算法的开销严丝合缝。
悬了三十年的问题,关了。
不做数学的朋友可以这么理解:你在一间黑屋子里找最低的角落,每次只能伸手摸一个位置的高度。三十年前有人给了一套摸法,保证摸这么多次一定够用。三十年没人知道存不存在更省事的摸法。现在证明了——不存在,这套摸法就是最佳。
顺便说一句为什么这类问题一悬就是三十年——说"我有一个好办法",把它写出来跑给大家看就行;说"不存在更好的办法",你要面对所有可能的办法,包括还没被任何人发明出来的那些,一个都不能漏。前者是展示一件作品,后者是给无穷多个未来画一条谁都跨不过去的线。
后者难产,不冤。
有两个细节,比结论本身有意思。
第一,这不是"帮我证个定理"一句话的事。那条 prompt 有 1200 个 token,中间来回澄清了两轮,模型连续推理了 148 分钟才吐出完整证明。
第二,作者在 GPT-5.4 和 5.5 上磨了整整一年,全军覆没。5.6 一出,过了。
就一年。
一年的提问,换两个半小时的证明。这笔账怎么算,取决于你信哪一边。
信 AI 的人看到的是:一个三十年没人关得掉的问题,现在的成本是一条 prompt,加两个半小时的电费。信人的人看到的是:所谓 AI 证明,底下垫着一个专家整整一年的失败、重构、再失败——把这一年算进成本,故事立刻没那么神了。
两边都对。这正是别扭的地方。
HN 上的数学家们没有欢呼。最集中的质疑是:prompt 里是不是藏了解题思路?磨一年,说明作者对这个问题的理解一直在逼近答案,模型可能只是补上了最后一跳。作者的回应是,早期那些尝试"真的不怎么样",而且 5.6 最后走的技术路线,他承认自己想不出来。这事暂时无解——prompt 原文没公开,他说要等论文审完。
也有人干脆泼冷水:这不算新鲜事,几十年前四色定理就是计算机参与证明的。话没错。但四色定理那会儿,机器是校对员。
这一次,机器交的是初稿。
而且这个速度不是突然冒出来的。去年 10 月就有研究员晒出过完整对话记录:GPT-5 Pro 在一个相近的数学问题上,把当时最好的结果往前推了一小步——那次的结局有点尴尬,人类数学家转头就在已有论文里翻出了一个更强的结果。一年半,从"小改进、还很快被人类反超",到"独立写出一份关掉三十年悬案的初稿",中间只隔着两代模型。
单独看哪一次都不吓人。连起来看才吓人。
吵归吵,有一件事没人质疑:证明对不对,查得出来。两个互不相识的小组把证明里最关键的一步各自验了一遍,一组用现成的数学工具,另一组干脆自己写了个验证程序。都过了。
顺带着,另一个角色的日子也要变了。当初稿可以两个半小时一份地生产,审稿人就成了流水线上最慢的那道工序——已经有人在问:谁来查第一万份 AI 初稿?
我真正想说的是这个。
整场讨论里,说得最准的是一个程序员:证明这种东西,对就是对,错就是错,当场就能查——这种反馈治得住模型的信口开河。
数学是全世界最容易判对错的领域。每一步推理都能被机器检查,错就是错,狡辩无效。
这不是运气,是训练方式决定的。答案能当场判对错的领域,AI 公司就能让机器自己出题、自己判卷、日夜不停地练,把千万道题连着标准答案一起喂给下一代模型;判不了对错的领域,花再多算力,也只能练出更流畅的废话。
能判对错,就能拿来练。
编程排第二——有测试兜着,但测试测不出"你其实想要什么"。
再往下,是我天天泡着的世界:企业业务。这三年我干的活,一多半是把 agent 塞进别人的业务流程里,最头疼的从来不是模型不够聪明,是没有人能立刻判它做得对不对。一份报价、一版投放方案、一次合规审查——没人能当场判对错,只有三个星期以后的客诉。
有客诉还算好的。更多时候连客诉都没有,单子静悄悄丢了,你连模型哪句话说错了都查不到。
所以 AI 吃掉各行各业的顺序,不是从易到难,是从容易判对错,到难判对错。
别再用"数学都被 AI 干了,你的工作还远吗"吓唬自己。规律其实反着来:你的工作越难被打分,AI 越拿你没办法——同时,你也越难吃到 AI 的红利。这是同一枚硬币的两面,挑不了边。
还有一条评论值得单独说。一个数学家讲,博士论文的大部分工作,本来就是"资深研究者不太费劲也能做出来的东西"——训练的意义在过程,不在结果。要是这类问题以后模型顺手就解了,博士该怎么带?
他说他很庆幸这事不归他管,因为他也没有任何好主意。
我同样没有。
但这个担忧可以往外推一圈。博士训练只是最先被照亮的角落——所有靠"做十年题才能出师"的行当,法律、精算、审计、架构师,都是靠新手做那些资深者懒得做的事,把人一点点练出来的。模型把这些事顺手做了,新手从哪儿长出来?
没人答得上。行业眼下的办法是假装这个问题不存在。
但那个磨了一年 prompt 的作者,倒是给了我一点别的东西。他不是外行,一年里每一次失败的提问,都建立在他对这个问题多年的理解上。1200 个 token 里压着的,是他知道哪条路走不通、哪一步值得赌。模型没有淘汰他——把他从证明者,改成了出题人。
148 分钟属于机器。那一年属于人。
至于这样的分工能维持多久,我不知道。三十年都等了,不差这一段。