Tech
费马大定理 11 天被机器核完:1340 万行 Lean 只回答了『对不对』,没回答『为什么对』
2026年9月5日 · 刘未鹏《暗时间》~1 min read
1637 年费马在书页边上写:我有一个奇妙的证明,可惜页边太窄写不下。2026 年 9 月 4 日,几十个 Claude 代理替他交了一份:1340 万行 Lean 代码,机器检查通过。页边这回够宽了,轮到人这辈子读不完。
30 秒读懂
9 月 4 日 Anthropic 研究博客披露:数十个 Claude 代理 11 天近乎自主写出费马大定理第一份端到端、机器检查通过的 Lean 证明:1340 万行、30,300 条定理、约 60 亿输出 token。
只用 Lean 三条标准公理;官方 comparator 工具确认命题与 Mathlib 自己的费马大定理表述一致;帝国理工 Kevin Buzzard 亲自编译复核,结论大意:对得上。
数学上几乎没有新东西:走的是 1995 年 Darmon–Diamond–Taylor 对怀尔斯证明的简化阐述路线,体量约为 Mathlib 的 5 倍。
真正变的是:核对一份已知证明,从「人核一年」压到「机器 11 天」。可这 1340 万行没打算给人读,「为什么对」那一层,Buzzard 要做,Anthropic 不做。
1 作业
11 天、1340 万行、六十亿 token,机器交上来的作业长这样
先把数摆齐,再谈它值不值。
发起人是 Anthropic 研究员 Tianyi Peng,他在哥伦比亚大学的团队做 AI 形式化工具。这回用 Claude Code 的多代理框架,跑一个「大致相当于 Claude Fable 5.1」的内部通用研究模型。人类的数学输入只有 Peng 偶尔几句高层指示,比如「Jacobian 优先当 scheme 处理」「尽快把 Mazur 定理推完」。
指标 数字
Lean 代码 1340 万行(Buzzard 编译实测 13.4M 行以上)
证出的定理 30,300 条,最终用到 29,500 条
体量对比 约为 Mathlib(Lean 社区主数学库)的 5 倍
输出 token 约 60 亿
早期失败尝试的残留 约占最终证明非样板行的 7%
费用没有官方数。Hacker News 上有人按每百万输出 token 50 美元估,约 30 万美元,这是网友估算,不是账单。
2 翻车
头几回全垮了,救场的是一张专门给机器看的任务图
代理不缺数学,缺的是记性和分工。
最早几次尝试的死法都一样:代理很快「丢失项目状态、停止有效协作」。你别看它一个人做题挺灵,几十个一起干,谁证到哪了、哪条能复用,没两天就乱成一锅粥。救场的是 Prove2Me,Peng 和哥大合作者做的开放协作形式化平台。
旧办法
每个代理自己记着项目全貌,靠上下文撑。上下文一满就忘,忘了就重做或停摆。
新办法
平台维护一张定理陈述的有向无环图,代理照图挑下一条证什么;定理陈述与证明分文件存,Lean 编译更快;每条定理配一句自然语言描述,方便搜索复用。
这东西工地上叫施工进度表:谁也不用把整栋楼记在脑子里,看表干活就行。HN 上有人挑刺说「最终还是靠人类造的工具」,这话没错。锤子也是人造的。
3 验收
对不对,机器说了算:Buzzard 亲自跑了一遍,对得上
怀尔斯当年等了两年,这份当天就有人复核完。
可信度看三样。证明只用 Lean 三条标准公理,没偷塞新公理;官方 comparator 工具确认最后证出的那句话跟 Mathlib 自己的费马大定理表述是同一句,防的是「证了个长得像的东西」;Kevin Buzzard,帝国理工的教授、2024 年起领着社区做 FLT 形式化的那位,当天把 1340 万行拉下来在 96 核机器上编译了一遍,耗时约为 Mathlib 的 20 倍,comparator 也跑了,结论大意:对得上。HN 有人担心 13M 行里藏着钻 Lean 漏洞的招,这一遍复核就是回答之一。
再看人核一份证明要多久。1993 年 6 月怀尔斯在三场讲座里宣布证明,两个月后一位审稿人的提问暴露出关键缺口,补了一年,最后和学生 Richard Taylor 一起堵上,1995 年 5 月发表 129 页正确版本。
Perelman 庞加莱猜想,2002 起
约 4 年
Helfgott 弱哥德巴赫,2013 起
13 年,仍在评审
人核时长按 Anthropic 博文脚注整理;Hales 的 12 人评审组审了 4 年只敢说「99% 确定」。11 天量的是形式化已知证明,不算发现。
Machines settled "is it right" in 11 days; "why it's right" still has no reader Buzzard: almost nothing new, mathematically 1993–1995 · HUMAN CORE 2026 · MACHINE CORE 129-page proof announced in 3 lectures, 1993 A referee's question the gap is exposed Patched for 1 year published in 1995 Dozens of agents + Prove2Me theorem DAG 29,500 intermediate theorems in 11 days Lean check passed only 3 axioms comparator: matches the Mathlib statement verification cost verification ≠ understanding The layer still empty: a living document for human readers Buzzard has promised to write it · Anthropic probably won't proof pipeline the missing layer Source: Anthropic research blog (2026-09-04) and Kevin Buzzard's blog post. Machines have pushed the cost of checking a known proof down to 11 days — but the document written for human readers still has no author.
4 分家
对不对与为什么对,这回头一次分了家
Buzzard 的博文标题是《FLT:Anthropic 抢在我前头了》,正文却没多少酸味。
他说得很直白,大意是:数学上这项工作几乎没告诉我们任何新东西。他早就 99.9% 确信怀尔斯的证明没问题,数论界多数人是 100%;这份形式化忠实跟着早期文献走,走的是 1995 年 Darmon、Diamond、Taylor 的简化阐述路线,不是他正在形式化的现代证明。路线经 Mazur 关于 Eisenstein 理想的工作,只覆盖素数 p≥17,小指数由此前别人已形式化的结果补齐。它真正告诉我们的,是自动形式化现在能做到什么:几千页文献,11 天,端到端。
可这 1340 万行是什么?Anthropic 自己的脚注说体量「可能远比需要的长」。没人读得完,也没打算给人读。Buzzard 向 EPSRC 要那 100 万英镑、5 年的时候,承诺的有两样:一份机器可查的证明,加一份供人类探索现代证明的动态文档。前一样 Anthropic 11 天做完了;后一样,他自己说,Anthropic 大概不会做。
我在外包那些年接过一个政府项目,一个 8 万行的存储过程,注释里留着三任前任的名字,末尾一句「别动第 4720 行」。那玩意儿能跑,跑出来的数也对。可为什么不能动,三个人没一个写下来。我动了,回滚花掉一个通宵。那 8 万行就是一份只有机器读得懂的证明:编译器点头,数字正确,人一句「为什么」都答不上。
核心 1340 万行回答了「费马大定理成立吗」:成立,机器查过。它没回答「为什么成立」,这一层此前是同一份文件里顺带给的,现在得单独有人做。
5 懂
讲不清十有八九没真懂,一份只有机器能读的证明算不算知识
刘未鹏《暗时间》里的判断,放这儿正好。
他说「教」是最好的「学」:一件事你讲不清楚,十有八九还没真懂;书写是为了更好的思考,把推理写下来,藏着的前提、假设、逻辑才会被逼到明面上。照这把尺子,1340 万行 Lean 是一份写下来的推理,每一步前提都摊开了。它满足了「书写」,却跳过了「教」:没有一个人能从头跟到尾,也就没有人被它逼着想通什么。
打个比方
一栋楼交付,有两份纸:验收合格证和施工图。合格证告诉你这楼能住,图纸告诉你哪堵是承重墙。以前两份是一伙人出的,现在合格证机器一天开完,图纸没人画。住是能住,哪天想砸墙,你手里只有一张盖了章的合格证。
Buzzard 看重的恰恰是图纸之外的用处。他说这套能力将来能实时形式化前沿研究,让论文评审不那么痛苦,还能「让我们诚实」:那些「专家都知道」、从来没人真写出来的结果,机器会无情地一条条标出来。HN 上另一个担心也成立:公认为真的证明,有多少会被翻出来是错的。
⚡ 为什么值得看: 「对」从此可以廉价批发,「懂」还是老价钱。以后数学家的活可能倒过来:机器负责说对不对,人负责把为什么对写成人读得懂的样子。
6 带走
这对你意味着什么:能编译通过的东西,看得懂的人越来越少
你不搞数论,这事也落到你桌上。
AI 写的代码测试全绿、审查全过,跟这 1340 万行是一个路数:对,机器查过;为什么这么写,问一圈没人答得上。收「对不对」的时候,认机器:测试、类型检查、形式化,谁不给面子就认谁。收「为什么对」的时候,只认人写的那份:设计说明、一段能讲给外行听的注释、一份你自己能从头讲到尾的复盘。第二份没人写,第一份再厚也只是一张合格证。
Buzzard 算过账,大意是:我花 5 年 100 万英镑,Anthropic 只花 11 天,但我怀疑他们花的钱更多。钱还不是最贵的那一栏。他那份给人看的动态文档,眼下还是没人替他做。
取材声明:本文思想框架取材自刘未鹏《暗时间》(教是最好的学、讲不清十有八九没真懂、书写是为了更好的思考);事件与数字出自 Anthropic 研究博客《Formalizing Fermat's Last Theorem》(2026 年 9 月 4 日)、Kevin Buzzard 同日博文《FLT: Anthropic has beaten me to it》及 Hacker News 公开讨论,英文引述为中文大意,费用系网友估算,以原始研究为准。本文为技术科普解读。
技术
费马大定理 11 天被机器核完:1340 万行 Lean 只回答了『对不对』,没回答『为什么对』
2026年9月5日 · 刘未鹏《暗时间》约 6 分钟
1637 年费马在书页边上写:我有一个奇妙的证明,可惜页边太窄写不下。2026 年 9 月 4 日,几十个 Claude 代理替他交了一份:1340 万行 Lean 代码,机器检查通过。页边这回够宽了,轮到人这辈子读不完。
30 秒读懂
9 月 4 日 Anthropic 研究博客披露:数十个 Claude 代理 11 天近乎自主写出费马大定理第一份端到端、机器检查通过的 Lean 证明:1340 万行、30,300 条定理、约 60 亿输出 token。
只用 Lean 三条标准公理;官方 comparator 工具确认命题与 Mathlib 自己的费马大定理表述一致;帝国理工 Kevin Buzzard 亲自编译复核,结论大意:对得上。
数学上几乎没有新东西:走的是 1995 年 Darmon–Diamond–Taylor 对怀尔斯证明的简化阐述路线,体量约为 Mathlib 的 5 倍。
真正变的是:核对一份已知证明,从「人核一年」压到「机器 11 天」。可这 1340 万行没打算给人读,「为什么对」那一层,Buzzard 要做,Anthropic 不做。
1 作业
11 天、1340 万行、六十亿 token,机器交上来的作业长这样
先把数摆齐,再谈它值不值。
发起人是 Anthropic 研究员 Tianyi Peng,他在哥伦比亚大学的团队做 AI 形式化工具。这回用 Claude Code 的多代理框架,跑一个「大致相当于 Claude Fable 5.1」的内部通用研究模型。人类的数学输入只有 Peng 偶尔几句高层指示,比如「Jacobian 优先当 scheme 处理」「尽快把 Mazur 定理推完」。
指标 数字
Lean 代码 1340 万行(Buzzard 编译实测 13.4M 行以上)
证出的定理 30,300 条,最终用到 29,500 条
体量对比 约为 Mathlib(Lean 社区主数学库)的 5 倍
输出 token 约 60 亿
早期失败尝试的残留 约占最终证明非样板行的 7%
费用没有官方数。Hacker News 上有人按每百万输出 token 50 美元估,约 30 万美元,这是网友估算,不是账单。
2 翻车
头几回全垮了,救场的是一张专门给机器看的任务图
代理不缺数学,缺的是记性和分工。
最早几次尝试的死法都一样:代理很快「丢失项目状态、停止有效协作」。你别看它一个人做题挺灵,几十个一起干,谁证到哪了、哪条能复用,没两天就乱成一锅粥。救场的是 Prove2Me,Peng 和哥大合作者做的开放协作形式化平台。
旧办法
每个代理自己记着项目全貌,靠上下文撑。上下文一满就忘,忘了就重做或停摆。
新办法
平台维护一张定理陈述的有向无环图,代理照图挑下一条证什么;定理陈述与证明分文件存,Lean 编译更快;每条定理配一句自然语言描述,方便搜索复用。
这东西工地上叫施工进度表:谁也不用把整栋楼记在脑子里,看表干活就行。HN 上有人挑刺说「最终还是靠人类造的工具」,这话没错。锤子也是人造的。
3 验收
对不对,机器说了算:Buzzard 亲自跑了一遍,对得上
怀尔斯当年等了两年,这份当天就有人复核完。
可信度看三样。证明只用 Lean 三条标准公理,没偷塞新公理;官方 comparator 工具确认最后证出的那句话跟 Mathlib 自己的费马大定理表述是同一句,防的是「证了个长得像的东西」;Kevin Buzzard,帝国理工的教授、2024 年起领着社区做 FLT 形式化的那位,当天把 1340 万行拉下来在 96 核机器上编译了一遍,耗时约为 Mathlib 的 20 倍,comparator 也跑了,结论大意:对得上。HN 有人担心 13M 行里藏着钻 Lean 漏洞的招,这一遍复核就是回答之一。
再看人核一份证明要多久。1993 年 6 月怀尔斯在三场讲座里宣布证明,两个月后一位审稿人的提问暴露出关键缺口,补了一年,最后和学生 Richard Taylor 一起堵上,1995 年 5 月发表 129 页正确版本。
Perelman 庞加莱猜想,2002 起
约 4 年
Helfgott 弱哥德巴赫,2013 起
13 年,仍在评审
人核时长按 Anthropic 博文脚注整理;Hales 的 12 人评审组审了 4 年只敢说「99% 确定」。11 天量的是形式化已知证明,不算发现。
对不对,机器 11 天答了;为什么对,还是没人读得完 Buzzard:数学上几乎没有新东西 1993–1995 · 人核 2026 · 机核 129 页证明 1993 年,3 场讲座上宣布 审稿人的提问 缺口暴露 补了 1 年 1995 年发表 数十个代理 + Prove2Me 的定理 DAG 29,500 条中间定理 11 天 Lean 检查通过 只用 3 条公理 comparator 确认与 Mathlib 命题一致 核对成本 验证 ≠ 理解 还空着的一层:给人读的动态文档 Buzzard 承诺要做 · Anthropic 大概不会做 证明流程 缺的那一层 来源:Anthropic 研究博客(2026-09-04)与 Kevin Buzzard 博文。机器把核对已知证明的成本压到了 11 天,但给人看的那份文档,还没人动笔。
4 分家
对不对与为什么对,这回头一次分了家
Buzzard 的博文标题是《FLT:Anthropic 抢在我前头了》,正文却没多少酸味。
他说得很直白,大意是:数学上这项工作几乎没告诉我们任何新东西。他早就 99.9% 确信怀尔斯的证明没问题,数论界多数人是 100%;这份形式化忠实跟着早期文献走,走的是 1995 年 Darmon、Diamond、Taylor 的简化阐述路线,不是他正在形式化的现代证明。路线经 Mazur 关于 Eisenstein 理想的工作,只覆盖素数 p≥17,小指数由此前别人已形式化的结果补齐。它真正告诉我们的,是自动形式化现在能做到什么:几千页文献,11 天,端到端。
可这 1340 万行是什么?Anthropic 自己的脚注说体量「可能远比需要的长」。没人读得完,也没打算给人读。Buzzard 向 EPSRC 要那 100 万英镑、5 年的时候,承诺的有两样:一份机器可查的证明,加一份供人类探索现代证明的动态文档。前一样 Anthropic 11 天做完了;后一样,他自己说,Anthropic 大概不会做。
我在外包那些年接过一个政府项目,一个 8 万行的存储过程,注释里留着三任前任的名字,末尾一句「别动第 4720 行」。那玩意儿能跑,跑出来的数也对。可为什么不能动,三个人没一个写下来。我动了,回滚花掉一个通宵。那 8 万行就是一份只有机器读得懂的证明:编译器点头,数字正确,人一句「为什么」都答不上。
核心 1340 万行回答了「费马大定理成立吗」:成立,机器查过。它没回答「为什么成立」,这一层此前是同一份文件里顺带给的,现在得单独有人做。
5 懂
讲不清十有八九没真懂,一份只有机器能读的证明算不算知识
刘未鹏《暗时间》里的判断,放这儿正好。
他说「教」是最好的「学」:一件事你讲不清楚,十有八九还没真懂;书写是为了更好的思考,把推理写下来,藏着的前提、假设、逻辑才会被逼到明面上。照这把尺子,1340 万行 Lean 是一份写下来的推理,每一步前提都摊开了。它满足了「书写」,却跳过了「教」:没有一个人能从头跟到尾,也就没有人被它逼着想通什么。
打个比方
一栋楼交付,有两份纸:验收合格证和施工图。合格证告诉你这楼能住,图纸告诉你哪堵是承重墙。以前两份是一伙人出的,现在合格证机器一天开完,图纸没人画。住是能住,哪天想砸墙,你手里只有一张盖了章的合格证。
Buzzard 看重的恰恰是图纸之外的用处。他说这套能力将来能实时形式化前沿研究,让论文评审不那么痛苦,还能「让我们诚实」:那些「专家都知道」、从来没人真写出来的结果,机器会无情地一条条标出来。HN 上另一个担心也成立:公认为真的证明,有多少会被翻出来是错的。
⚡ 为什么值得看: 「对」从此可以廉价批发,「懂」还是老价钱。以后数学家的活可能倒过来:机器负责说对不对,人负责把为什么对写成人读得懂的样子。
6 带走
这对你意味着什么:能编译通过的东西,看得懂的人越来越少
你不搞数论,这事也落到你桌上。
AI 写的代码测试全绿、审查全过,跟这 1340 万行是一个路数:对,机器查过;为什么这么写,问一圈没人答得上。收「对不对」的时候,认机器:测试、类型检查、形式化,谁不给面子就认谁。收「为什么对」的时候,只认人写的那份:设计说明、一段能讲给外行听的注释、一份你自己能从头讲到尾的复盘。第二份没人写,第一份再厚也只是一张合格证。
Buzzard 算过账,大意是:我花 5 年 100 万英镑,Anthropic 只花 11 天,但我怀疑他们花的钱更多。钱还不是最贵的那一栏。他那份给人看的动态文档,眼下还是没人替他做。
取材声明:本文思想框架取材自刘未鹏《暗时间》(教是最好的学、讲不清十有八九没真懂、书写是为了更好的思考);事件与数字出自 Anthropic 研究博客《Formalizing Fermat's Last Theorem》(2026 年 9 月 4 日)、Kevin Buzzard 同日博文《FLT: Anthropic has beaten me to it》及 Hacker News 公开讨论,英文引述为中文大意,费用系网友估算,以原始研究为准。本文为技术科普解读。
テクノロジー
费马大定理 11 天被机器核完:1340 万行 Lean 只回答了『对不对』,没回答『为什么对』
2026年9月5日 · 刘未鹏《暗时间》約 6 分
1637 年费马在书页边上写:我有一个奇妙的证明,可惜页边太窄写不下。2026 年 9 月 4 日,几十个 Claude 代理替他交了一份:1340 万行 Lean 代码,机器检查通过。页边这回够宽了,轮到人这辈子读不完。
30 秒读懂
9 月 4 日 Anthropic 研究博客披露:数十个 Claude 代理 11 天近乎自主写出费马大定理第一份端到端、机器检查通过的 Lean 证明:1340 万行、30,300 条定理、约 60 亿输出 token。
只用 Lean 三条标准公理;官方 comparator 工具确认命题与 Mathlib 自己的费马大定理表述一致;帝国理工 Kevin Buzzard 亲自编译复核,结论大意:对得上。
数学上几乎没有新东西:走的是 1995 年 Darmon–Diamond–Taylor 对怀尔斯证明的简化阐述路线,体量约为 Mathlib 的 5 倍。
真正变的是:核对一份已知证明,从「人核一年」压到「机器 11 天」。可这 1340 万行没打算给人读,「为什么对」那一层,Buzzard 要做,Anthropic 不做。
1 作业
11 天、1340 万行、六十亿 token,机器交上来的作业长这样
先把数摆齐,再谈它值不值。
发起人是 Anthropic 研究员 Tianyi Peng,他在哥伦比亚大学的团队做 AI 形式化工具。这回用 Claude Code 的多代理框架,跑一个「大致相当于 Claude Fable 5.1」的内部通用研究模型。人类的数学输入只有 Peng 偶尔几句高层指示,比如「Jacobian 优先当 scheme 处理」「尽快把 Mazur 定理推完」。
指标 数字
Lean 代码 1340 万行(Buzzard 编译实测 13.4M 行以上)
证出的定理 30,300 条,最终用到 29,500 条
体量对比 约为 Mathlib(Lean 社区主数学库)的 5 倍
输出 token 约 60 亿
早期失败尝试的残留 约占最终证明非样板行的 7%
费用没有官方数。Hacker News 上有人按每百万输出 token 50 美元估,约 30 万美元,这是网友估算,不是账单。
2 翻车
头几回全垮了,救场的是一张专门给机器看的任务图
代理不缺数学,缺的是记性和分工。
最早几次尝试的死法都一样:代理很快「丢失项目状态、停止有效协作」。你别看它一个人做题挺灵,几十个一起干,谁证到哪了、哪条能复用,没两天就乱成一锅粥。救场的是 Prove2Me,Peng 和哥大合作者做的开放协作形式化平台。
旧办法
每个代理自己记着项目全貌,靠上下文撑。上下文一满就忘,忘了就重做或停摆。
新办法
平台维护一张定理陈述的有向无环图,代理照图挑下一条证什么;定理陈述与证明分文件存,Lean 编译更快;每条定理配一句自然语言描述,方便搜索复用。
这东西工地上叫施工进度表:谁也不用把整栋楼记在脑子里,看表干活就行。HN 上有人挑刺说「最终还是靠人类造的工具」,这话没错。锤子也是人造的。
3 验收
对不对,机器说了算:Buzzard 亲自跑了一遍,对得上
怀尔斯当年等了两年,这份当天就有人复核完。
可信度看三样。证明只用 Lean 三条标准公理,没偷塞新公理;官方 comparator 工具确认最后证出的那句话跟 Mathlib 自己的费马大定理表述是同一句,防的是「证了个长得像的东西」;Kevin Buzzard,帝国理工的教授、2024 年起领着社区做 FLT 形式化的那位,当天把 1340 万行拉下来在 96 核机器上编译了一遍,耗时约为 Mathlib 的 20 倍,comparator 也跑了,结论大意:对得上。HN 有人担心 13M 行里藏着钻 Lean 漏洞的招,这一遍复核就是回答之一。
再看人核一份证明要多久。1993 年 6 月怀尔斯在三场讲座里宣布证明,两个月后一位审稿人的提问暴露出关键缺口,补了一年,最后和学生 Richard Taylor 一起堵上,1995 年 5 月发表 129 页正确版本。
Perelman 庞加莱猜想,2002 起
约 4 年
Helfgott 弱哥德巴赫,2013 起
13 年,仍在评审
人核时长按 Anthropic 博文脚注整理;Hales 的 12 人评审组审了 4 年只敢说「99% 确定」。11 天量的是形式化已知证明,不算发现。
正しいかは機械が 11 日で答えた。なぜ正しいかは、まだ誰も読み切れない Buzzard:数学的に新しいものはほぼない 1993–1995 · 人間コア 2026 · 機械コア 129 ページの証明 1993 年、3 回の講演で発表 査読者の問い 穴が露呈する 1 年かけて補修 1995 年に発表 数十のエージェント + Prove2Me の定理 DAG 中間定理 29,500 本 11 日間で Lean 検査を通過 公理は 3 つだけ comparator が Mathlib の命題と一致を確認 検証コスト 検証 ≠ 理解 まだ空いている層:人が読むための動的文書 Buzzard は書くと約束 · Anthropic はおそらく書かない 証明の流れ 欠けている層 出典:Anthropic 研究ブログ(2026-09-04)と Kevin Buzzard のブログ。機械は既知の証明の検証コストを 11 日まで縮めたが、人が読むための文書はまだ誰も書いていない。数値は元の研究に準じる。
4 分家
对不对与为什么对,这回头一次分了家
Buzzard 的博文标题是《FLT:Anthropic 抢在我前头了》,正文却没多少酸味。
他说得很直白,大意是:数学上这项工作几乎没告诉我们任何新东西。他早就 99.9% 确信怀尔斯的证明没问题,数论界多数人是 100%;这份形式化忠实跟着早期文献走,走的是 1995 年 Darmon、Diamond、Taylor 的简化阐述路线,不是他正在形式化的现代证明。路线经 Mazur 关于 Eisenstein 理想的工作,只覆盖素数 p≥17,小指数由此前别人已形式化的结果补齐。它真正告诉我们的,是自动形式化现在能做到什么:几千页文献,11 天,端到端。
可这 1340 万行是什么?Anthropic 自己的脚注说体量「可能远比需要的长」。没人读得完,也没打算给人读。Buzzard 向 EPSRC 要那 100 万英镑、5 年的时候,承诺的有两样:一份机器可查的证明,加一份供人类探索现代证明的动态文档。前一样 Anthropic 11 天做完了;后一样,他自己说,Anthropic 大概不会做。
我在外包那些年接过一个政府项目,一个 8 万行的存储过程,注释里留着三任前任的名字,末尾一句「别动第 4720 行」。那玩意儿能跑,跑出来的数也对。可为什么不能动,三个人没一个写下来。我动了,回滚花掉一个通宵。那 8 万行就是一份只有机器读得懂的证明:编译器点头,数字正确,人一句「为什么」都答不上。
核心 1340 万行回答了「费马大定理成立吗」:成立,机器查过。它没回答「为什么成立」,这一层此前是同一份文件里顺带给的,现在得单独有人做。
5 懂
讲不清十有八九没真懂,一份只有机器能读的证明算不算知识
刘未鹏《暗时间》里的判断,放这儿正好。
他说「教」是最好的「学」:一件事你讲不清楚,十有八九还没真懂;书写是为了更好的思考,把推理写下来,藏着的前提、假设、逻辑才会被逼到明面上。照这把尺子,1340 万行 Lean 是一份写下来的推理,每一步前提都摊开了。它满足了「书写」,却跳过了「教」:没有一个人能从头跟到尾,也就没有人被它逼着想通什么。
打个比方
一栋楼交付,有两份纸:验收合格证和施工图。合格证告诉你这楼能住,图纸告诉你哪堵是承重墙。以前两份是一伙人出的,现在合格证机器一天开完,图纸没人画。住是能住,哪天想砸墙,你手里只有一张盖了章的合格证。
Buzzard 看重的恰恰是图纸之外的用处。他说这套能力将来能实时形式化前沿研究,让论文评审不那么痛苦,还能「让我们诚实」:那些「专家都知道」、从来没人真写出来的结果,机器会无情地一条条标出来。HN 上另一个担心也成立:公认为真的证明,有多少会被翻出来是错的。
⚡ 为什么值得看: 「对」从此可以廉价批发,「懂」还是老价钱。以后数学家的活可能倒过来:机器负责说对不对,人负责把为什么对写成人读得懂的样子。
6 带走
这对你意味着什么:能编译通过的东西,看得懂的人越来越少
你不搞数论,这事也落到你桌上。
AI 写的代码测试全绿、审查全过,跟这 1340 万行是一个路数:对,机器查过;为什么这么写,问一圈没人答得上。收「对不对」的时候,认机器:测试、类型检查、形式化,谁不给面子就认谁。收「为什么对」的时候,只认人写的那份:设计说明、一段能讲给外行听的注释、一份你自己能从头讲到尾的复盘。第二份没人写,第一份再厚也只是一张合格证。
Buzzard 算过账,大意是:我花 5 年 100 万英镑,Anthropic 只花 11 天,但我怀疑他们花的钱更多。钱还不是最贵的那一栏。他那份给人看的动态文档,眼下还是没人替他做。
取材声明:本文思想框架取材自刘未鹏《暗时间》(教是最好的学、讲不清十有八九没真懂、书写是为了更好的思考);事件与数字出自 Anthropic 研究博客《Formalizing Fermat's Last Theorem》(2026 年 9 月 4 日)、Kevin Buzzard 同日博文《FLT: Anthropic has beaten me to it》及 Hacker News 公开讨论,英文引述为中文大意,费用系网友估算,以原始研究为准。本文为技术科普解读。