摘要
- 这篇要讲一个具体的转型信号:当AI能把一件曾经稀缺的专业能力(解开数学难题)变得唾手可得时,真正抗跌的不是"会不会解题",而是"谁能可信地验证这件事解没解成"——而验证本身也正经历一次静默的范式转移,从"找权威学者背书"变成"发布一份任何人都能在自己电脑上跑一遍的机器可验证协议"。这周最值得讲的AI人物,不是发布模型的人,是验证模型的人——曼彻斯特大学数学家Thomas Bloom。他靠一个2023年出于个人方便搭建的业余项目,意外成了全球唯一有资格给"AI解开数学难题"这类宣称盖章或撕掉的裁判。这份报告要讲的,是他从籍籍无名的数论学者,到两次被卷进AI数学突破争议核心、给出两次截然相反判决的过程,以及普林斯顿数学家Noga Alon那句朴素的反应——"一旦AI开始解决,就没有意义了,所以我不再费劲了"。
一个业余项目,怎么就变成了公共基础设施
Bloom本科在牛津大学Merton学院读数学与哲学,后在布里斯托大学攻读数学博士(导师Trevor Wooley),2014年拿到学位。此后先后做过布里斯托大学Heilbronn研究员、剑桥大学博士后(跟随Timothy Gowers)、牛津大学研究员,2024年落脚曼彻斯特大学,拿到英国皇家学会研究员职位。他的专业是算术组合数学与解析数论,学界评价他是"冉冉升起的新星"——2020年7月他与Sisask合作证明:任何倒数之和发散的集合,必定包含长度为3的等差数列,这是Erdős等差数列猜想相关的一项重要部分性结果。(Wikipedia,曼彻斯特大学研究档案,Quanta Magazine)
2023年初,他做了一件纯粹图自己方便的事:把尽可能多的埃尔德什(20世纪最多产的数学家之一,一生留下数千道未解猜想)遗留猜想收集成一份清单,起初只是为自己用。据Quanta Magazine报道,他当时的想法是"心想着大概也没人会用,干脆做个网站"——这个网站背后的Python代码,他是用ChatGPT写的。在2023年初,这本身已经是件值得记录的事:这个日后成为"AI数学宣称审判庭"的网站,自己的诞生就借了AI一臂之力。这个网站(erdosproblems.com)现在收录近一千道源自或经埃尔德什传播的问题,约三分之一已被解决,还在持续加功能,最新一项是给每道题目配一个独立讨论区。2025年8月,Bloom与数学家Terence Tao提议了一个众包项目,把erdosproblems.com与OEIS(整数数列在线百科全书)链接起来,进一步扩大这个基础设施的连接面。(Quanta Magazine,Xena Project)
第一次判决:一次戏剧性的失实陈述
Bloom没有申请这个仲裁者角色,是AI公司自己的宣称把这个角色塞给了他。2025年10月,时任OpenAI VP Kevin Weil宣称GPT-5解开了十道Erdős猜想。Bloom核实后发现:模型没有产出任何原创证明,只是从数学文献里检索出了已有的解法——这些解法他此前没收录进数据库,所以网站显示"未解决",实际上早有人解过。他公开称这是"一次戏剧性的失实陈述",并澄清:"'未解决'这个状态只意味着我个人没收录到解决它的论文,不代表这道题真的没人解过。"(Quanta Magazine)
这不是孤例。同一篇Quanta报道还记录了一起更早的乌龙:一名用户圣诞节清晨在Bloom的网站上发布了一份"证明",宣称这是"LLM首次完全自主解开一道此前人类未解开的Erdős问题"——数小时后另一名用户指出,埃尔德什本人早在1977年的一篇论文里就给出过这道题(编号333)的解法。发帖者随后坦承错误,向社区呼吁:"我正式请求所有成员,更加重视对当前标注为'未解决'的问题做文献检索……作为一个已经两次栽在这上面的人,这种感觉相当难受。"(Quanta Magazine)
第二次判决:这次是big news
2026年8月,同样的角色再次落在他身上,这次他给出了截然不同的评价。面对OpenAI未发布模型Astra宣称解开十道跨八个数学分支、悬置十年以上的难题,Bloom核实后在X上公开称之为"big news",评价甚至高于今年5月OpenAI发布的另一个结果——原话是:"或许没有单位距离猜想反例结果那么大,但就构造性结果而言,这是件大事。"他给出的判断依据具体、可复现:这次的证明用Lean 4形式化,发布了机器可验证的证书,"一份Lean证书不是社会性信号——它要么编译通过,要么不通过,任何人拿一台笔记本电脑就能跑一遍"。(explainx.ai,Quanta Magazine)
两次判决的对比,恰恰是理解这个人的核心:第一次,验证方式是请几位权威数学家读一遍、用声誉背书(这次背书本身也失败了);第二次,验证方式变成了发布任何人都能在本地机器上跑通过或跑不过的代码。Bloom前后给出相反判决,不是因为他改了标准,而是因为核实对象本身的可验证程度发生了质变——这恰恰证明了他判断的一致,不是随意翻脸。
另一个反应:普林斯顿数学家已经不再费力气
Quanta的报道里,还记录了一个和Bloom形成对照的反应——普林斯顿数学家Noga Alon的态度转变。Alon是组合数学与理论计算机科学领域的顶尖学者,估计自己一生解过几十道Erdős猜想,但他现在已经停止尝试。他的原话:"一旦AI开始解决这些问题,就没有意义了。"(Quanta Magazine)
同一篇报道还记录了另一位数学家、曾与DeepMind合作攻克Erdős问题的Carlo Pagano,对"用Erdős猜想当AI数学能力基准"这套做法本身提出保留:"Erdős问题在某种意义上并不是很好的基准……同样重要的是,也要在那些我们知道具有更广泛价值的问题上做这件事。"这提醒我们,即便Bloom这套验证基础设施本身可信,它衡量的问题域(埃尔德什遗留的问题清单)也不等同于数学研究的全部前沿,这是理解本文结论边界时需要留意的一点。(Quanta Magazine)
这个裁判为什么只能是他,不能是公司自己
AI公司自己在2025年10月做过一次失实宣称,且被Bloom一人当场核实拆穿,网站社区内部还发生过至少一起类似乌龙。这说明"AI公司自己宣布突破"这个信息源存在结构性的利益冲突——公司有动机把"检索到已有解法"包装成"原创发现"以制造声量,却没有能力或动机先自我核实清楚就发布。真正能识别"这是检索还是发现"的,只能是对整个问题域了如指掌、且没有利益关联的独立第三方——这样的人本身就极稀缺,因为"对某个冷门数学分支了如指掌"这件事,天然只集中在极少数专业研究者身上。
Bloom能扮演这个角色,不是因为他被任命或雇佣,是因为他此前出于个人兴趣做了一件笨功夫——花时间把近千道问题逐一收录、标注状态——这件事本身构成了一个别人没有的、独一无二的核查基础设施。这暴露了一个更普遍的规律:当AI开始大规模宣称"突破"时,能可信验证这些宣称的,往往不是最聪明的人,而是最早开始做那件笨功夫、把领域知识结构化到可核查程度的人。这个角色的稀缺性,不会随AI变强而消失,反而会随着更多AI公司做出更多类似宣称而愈发抢手——Bloom现在事实上成了这个细分领域里"AI数学突破"的准官方仲裁人,而这个位置是他自己十年积累无意中造出来的,不是任何机构指派的。
随着更多公司卷入用AI做科研这场竞赛(参考本期企业篇Discovery Loop的报道),谁来验证AI的科研突破宣称,会成为一个越来越关键、却越来越稀缺的角色——不是每个学科都恰好有一个像Bloom这样十年前出于兴趣做了笨功夫的人存在。数学领域算幸运的(有Bloom,有Lean形式化证明这套天然适配"机器可验证"的工具),但生物、材料、化学这些实验驱动的学科,验证一个AI宣称的"新发现"往往需要真实世界的湿实验,周期以月甚至年计,不存在"Lean证书秒验证"这种捷径——这意味着这些学科的"宣称到验证"时间差会比数学领域更长、更危险,是这个行业被低估的系统性风险,不只是数学圈的趣闻。
Noga Alon那句话,是这场竞赛里最诚实的人的反应
多数报道聚焦"AI又解开了什么难题"这个技术层面的叙事,但Alon那句"一旦AI开始解决,就没有意义了,所以我不再尝试了"是一个很少被展开讨论、却极具信息量的人的反应——它不是恐慌,也不是欢呼,而是一种理性的撤退:当一件事(解Erdős猜想)曾经的价值构成里,"稀缺性"(我是极少数能解开这道题的人之一)占了很大比重,而AI让这种稀缺性快速贬值时,连普林斯顿级别的顶尖数学家都会诚实地承认"不再费这个劲了"。
这对任何以专业稀缺性为核心竞争力的知识工作者(包括教育、内容、咨询从业者)都是一个具体、可感知的先兆——不是"AI会不会取代你",而是"当AI把你曾经引以为傲的那件难事变得唾手可得时,你自己会不会像Alon一样,理性地选择不再做那件事"。这比空泛的AI威胁论,更值得认真对待,也更值得每一个知识型工作者对着镜子问自己一遍。
值得补充的是,Alon的撤退并非普遍反应——同一个领域里,Bloom选择的路径恰恰相反:他没有因为AI能解题就停止工作,而是把自己的角色从"解题者"主动转移到了"验证基础设施的建造与维护者"。这是一个具体、可复制的应对范式:当一项技能被AI快速商品化,与其像Alon一样理性退出,不如去做"给这项技能的产出把关"这件事——后者短期内几乎不可能被同一套AI技术自我替代(用AI验证AI会陷入循环信任问题),这可能是知识工作者在这一波替代浪潮里,最值得考虑的一种转型方向。
置信度与局限
Bloom对Astra结果的正面评价、Alon的原话、333号问题乌龙事件,均出自Quanta Magazine 8月3日文章(记者Konstantin Kakaes),是权威科学媒体的一手报道,可信度高。Bloom本人的学术履历交叉核对了Wikipedia、曼彻斯特大学研究档案、个人主页,一致,可信度高。但"验证基础设施跟不上宣称速度是系统性风险"这一判断、"生物材料等实验驱动学科验证周期更长更危险"这一延伸推理,都是这篇文章的推理延伸,不是任何一手信源直接下的结论。Carlo Pagano对"Erdős问题是否是好基准"的质疑也提醒读者:Bloom的验证权威目前局限在"Erdős遗留问题"这一特定问题域,不能直接外推到数学研究的全部前沿。
参考文献
- Wikipedia, "Thomas Bloom (mathematician)," en.wikipedia.org
- University of Manchester Research, Thomas Bloom研究档案,research.manchester.ac.uk
- Quanta Magazine, "Why the Legendary Erdős Problems Are Falling to AI," 2026-08-03,quantamagazine.org
- explainx.ai, "OpenAI Astra: Ten Math Proofs With Lean Certificates," 2026,explainx.ai
- Xena Project, "Formalization of Erdős Problems," 2025-12-05,xenaproject.wordpress.com