当AI能证出定理,数学家反而慌了:机器给出答案 人类却失去了理解

2026年08月07日 13:40 次阅读 稿源:网易智能 条评论

7月下旬,在费城举行的国际数学家大会上,陶哲轩描述了一种以前没有过的情况:一项重要结果已经被证明,验证也通过了,却没人能解释这份证明为什么成立,更没办法把它讲清楚、让其他数学家读懂、复用、传下去。



数学界还没真正走到这一步。但要走到那里所需要的技术,已经一项项出现了。AI开始参与文献搜索、构造例子、补齐推导,甚至生成新的证明和反例;形式化工具又能检查其中一部分结果是否正确。生成证明、验证证明、理解证明,开始由不同的人和工具来做,快慢也不同。

这种变化在大会上引发了明显分歧。刚获得菲尔兹奖的雅各布·齐默尔曼判断,AI很快会在当代专业数学工作上达到稳健的超人水平。 同样获得菲尔兹奖的中国数学家、芝加哥大学教授邓煜则认为,AI更可能帮助数学家,而不是取代他们。

争论已经不只围绕AI能否解出一道题。当证明的产量迅速增加,数学中还有哪些工作仍然稀缺?

一、证明开始变得丰裕

最近一份数学反例的产生过程,就能看到这种变化。

几十年前,保罗·埃尔德什(PaulErdős)提出平面单位距离问题:给定一组点,其中最多能有多少对点恰好相距一个单位?他后来猜测,随着点的数量增加,单位距离对的数量不会比点数增长得快太多。

在一篇新论文中,OpenAI的一款内部模型构造出反例,给出了一系列突破这一限制的点集。

论文作者没有把模型输出直接作为最终成果。摘要里说得很清楚:这是AI给出的反例的"精简版",由人消化过、也验证过。最早的论证是模型一次跑出来的,之后多位数学家接手,检查推导、简化证明、辨认哪些想法其实来自已有研究,再把机器给出的路径改写成同行看得懂、能审阅的论文。Codex也参与了后面的文字修改。

一份证明由此被拆成三个环节:先找到可能成立的路径,再确认每一步是否正确,最后解释它为什么有效、与既有知识有什么关系。

过去,这三件事通常由同一批人连续完成。数学家在寻找和修改证明的过程中逐渐形成理解。现在,AI可以快速尝试大量方向,也可以写出很长的论证;形式化工具能够承担一部分检查,理解却没有随生成速度一起加快。

陶哲轩把这种变化称为"证明丰裕"。 单位距离反例既显示了模型的能力,它走通了一条部分专家考虑过却未能完成的路径;也显示了人类工作的必要,最终进入数学共同体的,是经过验证、简化和解释的版本。

过去最难的是找到答案,接下来更费力的工作,可能是从越来越多的答案里挑出有价值的,再把它们讲成人能真正掌握的东西。

在更多数学家的日常工作中,这种变化还没有表现为机器独立攻克著名难题。它首先出现在找文献、试方法和检查证明的工作台上。

二、AI已经进入数学家的工作台

对大多数数学家来说,AI更像一张可以随时展开的地图,帮助他们进入不熟悉的领域。

邓煜描述了一种较为乐观的分工:数学家仍然负责提出新的理论、想法和框架,AI承担其中的技术细节。 随着AI能力增强,哪些事会被算作"技术细节"会不断变化,但做数学本身的乐趣不会因此消失。

布兰迪斯大学研究生瓦西里·涅克拉索夫(VasiliyNeckrasov)举过一个例子。过去,如果他想调用另一个数学分支的方法,可能要先翻完一本500页的教材,而且读到最后才知道这套工具是否适合自己的问题。现在,他会先让AI寻找相关定理和论文,再回到原始材料中定向阅读。AI没有替他学完这门数学,但减少了大量走错书架的时间。

还有一些工具已经不止于搜索,开始承担局部的解题工作。数学家阿隆索·卡斯蒂略-拉米雷斯(Alonso Castillo-Ramirez)曾让ChatGPT构造一种满足特殊条件的元胞自动机。这个例子即使借助传统程序也很难找到,ChatGPT给出了可用结果。不过,它只是一个更大研究项目中的组成部分:问题由人提出,这个例子为什么重要、应当放进哪段论证,也由人判断。

涅克拉索夫用得更深。据Understanding AI报道,他每月花200美元使用Codex,让它搜文献、补证明的缺口、检查论文草稿。即使要AI证某个结论,他也会先在心里想好项目的大致轮廓:要读哪些论文、用什么方法、想推进到哪一步。用他自己的话说,他要AI加快自己的想法,而不是替他想。

在这些场景中,AI压缩了搜索、试错和展开技术细节所需的时间。数学家把更多精力留给上游:决定什么问题值得研究,哪条路线值得继续,一个局部结果能否嵌入完整理论。 AI更像资料员、计算助手,也像一个初级审稿人,但不是接管项目的研究者。

但这种分工也有边界。陶哲轩提醒,AI推荐跨领域文献时仍可能编造引用。数学家之所以敢在部分环节使用它,往往是因为输出可以回到论文、计算或证明中重新检查。 AI降低了寻找答案的成本,最后的判断责任仍在人手里。

但找错方向、补不上证明、在几百页教材里摸索,本身就是数学家学会做判断的过程。 当工具能绕过这些弯路,问题也就转到了另一个层面:数学家是怎么被训练出来的?

三、被拿走的不只是重复劳动

对于已经形成研究判断的数学家,AI可以节省时间。对于仍在学习如何判断的人,同一种便利可能拿走训练本身。

数学研究生通常不会一开始就面对最著名、最困难的猜想。导师会交给他们范围较小、存在推进可能的问题,让他们在查文献、尝试错误路线、发现证明缺口和接受同行质疑的过程中,逐渐学会怎样做研究。

Understanding AI采访的数学家担心,当AI能够迅速解决这类"适合训练"的问题时,学生仍可能交出正确答案,却没有经历形成研究直觉的过程。

陶哲轩把研究中的困难分成两类。一类是重复计算、机械整理等人为摩擦,交给工具通常没有问题;另一类是在理解概念、拆分问题和判断路线时遇到的自然摩擦,它本身就是学习的一部分。AI如果把后一类困难也直接抹平,学生得到的不只是帮助,还可能绕过能力形成的过程。

教育风险也不能只用"有没有作弊"来衡量。即使答案完全正确,学生仍可能慢慢失去独立读论文的能力、长时间没有进展也不放弃的耐心,以及检查自己推理的习惯。陶哲轩在面向学生的讨论中提醒,有些人的成绩在提高,能力却在退化。 他主张让人留在过程里:学生要说明自己怎么使用AI、怎么验证输出,也要能脱离工具把结果讲清楚。

年轻数学家的焦虑还来自职业制度。卡内基梅隆大学教授杰里米·阿维加德(Jeremy Avigad)告诉Understanding AI,职业早期的数学家通常更加不安,因为他们还没有稳定的位置和声誉。一些受访者担心,如果公众把"AI能够生成证明"理解成"数学家已经没有必要",数学研究的公共资助也可能受到影响。这仍是一种担忧,并非已经发生的预算削减。

科研制度已经开始为另一种工作方式做准备。美国白宫科技政策办公室7月发布的《科学:新的黄金时代》提出试验"AI原生科研机构"。报告认为,现有的资助、出版和贡献认定机制,是按过去人类科研的节奏搭起来的;未来需要更大规模的验证设施、更开放更快的发布方式,以及更细的贡献划分,把验证、复现、数据、工具这些不同的劳动分别识别出来。

数学在报告中被作为先行案例:发现证明通常比检查证明更难,形式化验证可能扩大协作规模。报告的预算优先事项仍要求联邦机构支持数学与计算科学的基础研究;它把制度调整的重点放在科研贡献如何被确认和分配上。

当模型、软件和人开始共同参与证明的生成、检查和解释时,"谁完成了工作"就很难再用一个名字回答。 这带来一连串新问题:大学要决定学生必须亲自走过哪些环节,期刊要确定什么样的结果才算可以发表,资助机构要判断这三种劳动里哪些值得资助。

四、证明不是数学的全部

早在生成式AI出现以前,数学家已经争论过:"证明正确"与"数学有所进步"是不是同一件事。

1994年,几何学家威廉·瑟斯顿(William Thurston)在《论数学中的证明与进步》中提出,讨论数学家的工作,不应从"数学家怎样证明定理"开始。这个问题预先假定,数学进步就是不断增加定理和证明。瑟斯顿把问题改成了:数学家怎样增进人类对数学的理解?

他当时讨论的还是计算机辅助证明。四色定理依靠大规模计算完成后,数学界的争议并不主要来自人们怀疑答案是否正确,而是因为知道一个结论为真,与理解它为什么为真,仍是两件事。瑟斯顿还举过一个更日常的例子:计算机可以打印出前1万个素数,人们真正想要的通常不是一叠答案,而是这些答案背后的规律。

三十多年后,陶哲轩在国际数学家大会上列出的数学目标更长:解决问题、建立理论、理解世界、建设共同体、训练下一代、积累共享知识,以及创造审美价值。

过去,这些目标大体能够一起推进。攻克一道难题往往会带来新的方法,培养参与者,也让围绕问题形成的共同体获得一套新的语言。AI开始松动这种联系。 模型可以直接找到终点,却未必留下探索过程中形成的概念、比喻和中间工具;形式验证能够确认一份长证明,却未必指出哪段思想值得迁移到另一个问题。

这也是陶哲轩主张提高验证和"消化"工作地位的原因。 把机器生成的证明改写得更短、更清楚,指出它与既有理论的联系,讲成同行能够讨论的报告,再让它进入课程和教材。这些过去常被视为证明完成后的附属工作,可能成为证明丰裕时代更稀缺的劳动。

数学家的声誉也可能随之调整。率先证明重要定理,长期是数学声誉的重要来源;如果原始证明越来越容易生成,那么提出好问题、识别有价值的方法、发现隐藏错误、把陌生结果讲成大家都能懂的人,需要得到更多认可。

这不等于理论建构、审美判断和清晰解释会永远由人类独占。齐默尔曼认为,把这些能力视作AI无法跨越的边界,只是在不断移动目标。即使机器最终也能完成这些任务,数学仍要区分两个问题:系统能够生产什么,以及人们希望从做数学这件事中获得什么。

机器或许已经完成了求解,数学共同体的工作仍未完成。

对文章打分

当AI能证出定理,数学家反而慌了:机器给出答案 人类却失去了理解

1 (50%)
已有 条意见

    最新资讯

    加载中...

    编辑精选

    加载中...

    热门评论

      Top 10

      招聘

      created by ceallan