vlog
← 返回全部文章

Tech

费马大定理 11 天被机器核完:1340 万行 Lean 只回答了『对不对』,没回答『为什么对』

2026年9月5日 · 刘未鹏《暗时间》~1 min read

1637 年费马在书页边上写:我有一个奇妙的证明,可惜页边太窄写不下。2026 年 9 月 4 日,几十个 Claude 代理替他交了一份:1340 万行 Lean 代码,机器检查通过。页边这回够宽了,轮到人这辈子读不完。

30 秒读懂
1作业

11 天、1340 万行、六十亿 token,机器交上来的作业长这样

先把数摆齐,再谈它值不值。

发起人是 Anthropic 研究员 Tianyi Peng,他在哥伦比亚大学的团队做 AI 形式化工具。这回用 Claude Code 的多代理框架,跑一个「大致相当于 Claude Fable 5.1」的内部通用研究模型。人类的数学输入只有 Peng 偶尔几句高层指示,比如「Jacobian 优先当 scheme 处理」「尽快把 Mazur 定理推完」。

指标数字
Lean 代码1340 万行(Buzzard 编译实测 13.4M 行以上)
证出的定理30,300 条,最终用到 29,500 条
体量对比约为 Mathlib(Lean 社区主数学库)的 5 倍
输出 token约 60 亿
早期失败尝试的残留约占最终证明非样板行的 7%
费用没有官方数。Hacker News 上有人按每百万输出 token 50 美元估,约 30 万美元,这是网友估算,不是账单。
2翻车

头几回全垮了,救场的是一张专门给机器看的任务图

代理不缺数学,缺的是记性和分工。

最早几次尝试的死法都一样:代理很快「丢失项目状态、停止有效协作」。你别看它一个人做题挺灵,几十个一起干,谁证到哪了、哪条能复用,没两天就乱成一锅粥。救场的是 Prove2Me,Peng 和哥大合作者做的开放协作形式化平台。

旧办法

每个代理自己记着项目全貌,靠上下文撑。上下文一满就忘,忘了就重做或停摆。

新办法

平台维护一张定理陈述的有向无环图,代理照图挑下一条证什么;定理陈述与证明分文件存,Lean 编译更快;每条定理配一句自然语言描述,方便搜索复用。

这东西工地上叫施工进度表:谁也不用把整栋楼记在脑子里,看表干活就行。HN 上有人挑刺说「最终还是靠人类造的工具」,这话没错。锤子也是人造的。

3验收

对不对,机器说了算:Buzzard 亲自跑了一遍,对得上

怀尔斯当年等了两年,这份当天就有人复核完。

可信度看三样。证明只用 Lean 三条标准公理,没偷塞新公理;官方 comparator 工具确认最后证出的那句话跟 Mathlib 自己的费马大定理表述是同一句,防的是「证了个长得像的东西」;Kevin Buzzard,帝国理工的教授、2024 年起领着社区做 FLT 形式化的那位,当天把 1340 万行拉下来在 96 核机器上编译了一遍,耗时约为 Mathlib 的 20 倍,comparator 也跑了,结论大意:对得上。HN 有人担心 13M 行里藏着钻 Lean 漏洞的招,这一遍复核就是回答之一。

再看人核一份证明要多久。1993 年 6 月怀尔斯在三场讲座里宣布证明,两个月后一位审稿人的提问暴露出关键缺口,补了一年,最后和学生 Richard Taylor 一起堵上,1995 年 5 月发表 129 页正确版本。

怀尔斯 FLT,1993 起
约 2 年
Hales 开普勒猜想,1998 起
4 年
Perelman 庞加莱猜想,2002 起
约 4 年
Helfgott 弱哥德巴赫,2013 起
13 年,仍在评审
Claude 代理形式化 FLT
11 天

人核时长按 Anthropic 博文脚注整理;Hales 的 12 人评审组审了 4 年只敢说「99% 确定」。11 天量的是形式化已知证明,不算发现。

Machines settled "is it right" in 11 days; "why it's right" still has no readerBuzzard: almost nothing new, mathematically1993–1995 · HUMAN CORE2026 · MACHINE CORE129-page proofannounced in 3 lectures, 1993A referee's questionthe gap is exposedPatched for 1 yearpublished in 1995Dozens of agents+ Prove2Me theorem DAG29,500 intermediate theoremsin 11 daysLean check passedonly 3 axiomscomparator: matches the Mathlib statementverification costverification ≠ understandingThe layer still empty: a living document for human readersBuzzard has promised to write it · Anthropic probably won'tproof pipelinethe missing layer
Source: Anthropic research blog (2026-09-04) and Kevin Buzzard's blog post. Machines have pushed the cost of checking a known proof down to 11 days — but the document written for human readers still has no author.
4分家

对不对与为什么对,这回头一次分了家

Buzzard 的博文标题是《FLT:Anthropic 抢在我前头了》,正文却没多少酸味。

他说得很直白,大意是:数学上这项工作几乎没告诉我们任何新东西。他早就 99.9% 确信怀尔斯的证明没问题,数论界多数人是 100%;这份形式化忠实跟着早期文献走,走的是 1995 年 Darmon、Diamond、Taylor 的简化阐述路线,不是他正在形式化的现代证明。路线经 Mazur 关于 Eisenstein 理想的工作,只覆盖素数 p≥17,小指数由此前别人已形式化的结果补齐。它真正告诉我们的,是自动形式化现在能做到什么:几千页文献,11 天,端到端。

可这 1340 万行是什么?Anthropic 自己的脚注说体量「可能远比需要的长」。没人读得完,也没打算给人读。Buzzard 向 EPSRC 要那 100 万英镑、5 年的时候,承诺的有两样:一份机器可查的证明,加一份供人类探索现代证明的动态文档。前一样 Anthropic 11 天做完了;后一样,他自己说,Anthropic 大概不会做。

我在外包那些年接过一个政府项目,一个 8 万行的存储过程,注释里留着三任前任的名字,末尾一句「别动第 4720 行」。那玩意儿能跑,跑出来的数也对。可为什么不能动,三个人没一个写下来。我动了,回滚花掉一个通宵。那 8 万行就是一份只有机器读得懂的证明:编译器点头,数字正确,人一句「为什么」都答不上。

核心

1340 万行回答了「费马大定理成立吗」:成立,机器查过。它没回答「为什么成立」,这一层此前是同一份文件里顺带给的,现在得单独有人做。

5懂

讲不清十有八九没真懂,一份只有机器能读的证明算不算知识

刘未鹏《暗时间》里的判断,放这儿正好。

他说「教」是最好的「学」:一件事你讲不清楚,十有八九还没真懂;书写是为了更好的思考,把推理写下来,藏着的前提、假设、逻辑才会被逼到明面上。照这把尺子,1340 万行 Lean 是一份写下来的推理,每一步前提都摊开了。它满足了「书写」,却跳过了「教」:没有一个人能从头跟到尾,也就没有人被它逼着想通什么。

打个比方

一栋楼交付,有两份纸:验收合格证和施工图。合格证告诉你这楼能住,图纸告诉你哪堵是承重墙。以前两份是一伙人出的,现在合格证机器一天开完,图纸没人画。住是能住,哪天想砸墙,你手里只有一张盖了章的合格证。

Buzzard 看重的恰恰是图纸之外的用处。他说这套能力将来能实时形式化前沿研究,让论文评审不那么痛苦,还能「让我们诚实」:那些「专家都知道」、从来没人真写出来的结果,机器会无情地一条条标出来。HN 上另一个担心也成立:公认为真的证明,有多少会被翻出来是错的。

⚡

为什么值得看:「对」从此可以廉价批发,「懂」还是老价钱。以后数学家的活可能倒过来:机器负责说对不对,人负责把为什么对写成人读得懂的样子。

6带走

这对你意味着什么:能编译通过的东西,看得懂的人越来越少

你不搞数论,这事也落到你桌上。

AI 写的代码测试全绿、审查全过,跟这 1340 万行是一个路数:对,机器查过;为什么这么写,问一圈没人答得上。收「对不对」的时候,认机器:测试、类型检查、形式化,谁不给面子就认谁。收「为什么对」的时候,只认人写的那份:设计说明、一段能讲给外行听的注释、一份你自己能从头讲到尾的复盘。第二份没人写,第一份再厚也只是一张合格证。

Buzzard 算过账,大意是:我花 5 年 100 万英镑,Anthropic 只花 11 天,但我怀疑他们花的钱更多。钱还不是最贵的那一栏。他那份给人看的动态文档,眼下还是没人替他做。

取材声明:本文思想框架取材自刘未鹏《暗时间》(教是最好的学、讲不清十有八九没真懂、书写是为了更好的思考);事件与数字出自 Anthropic 研究博客《Formalizing Fermat's Last Theorem》(2026 年 9 月 4 日)、Kevin Buzzard 同日博文《FLT: Anthropic has beaten me to it》及 Hacker News 公开讨论,英文引述为中文大意,费用系网友估算,以原始研究为准。本文为技术科普解读。

技术

费马大定理 11 天被机器核完:1340 万行 Lean 只回答了『对不对』,没回答『为什么对』

2026年9月5日 · 刘未鹏《暗时间》约 6 分钟

1637 年费马在书页边上写:我有一个奇妙的证明,可惜页边太窄写不下。2026 年 9 月 4 日,几十个 Claude 代理替他交了一份:1340 万行 Lean 代码,机器检查通过。页边这回够宽了,轮到人这辈子读不完。

30 秒读懂
1作业

11 天、1340 万行、六十亿 token,机器交上来的作业长这样

先把数摆齐,再谈它值不值。

发起人是 Anthropic 研究员 Tianyi Peng,他在哥伦比亚大学的团队做 AI 形式化工具。这回用 Claude Code 的多代理框架,跑一个「大致相当于 Claude Fable 5.1」的内部通用研究模型。人类的数学输入只有 Peng 偶尔几句高层指示,比如「Jacobian 优先当 scheme 处理」「尽快把 Mazur 定理推完」。

指标数字
Lean 代码1340 万行(Buzzard 编译实测 13.4M 行以上)
证出的定理30,300 条,最终用到 29,500 条
体量对比约为 Mathlib(Lean 社区主数学库)的 5 倍
输出 token约 60 亿
早期失败尝试的残留约占最终证明非样板行的 7%
费用没有官方数。Hacker News 上有人按每百万输出 token 50 美元估,约 30 万美元,这是网友估算,不是账单。
2翻车

头几回全垮了,救场的是一张专门给机器看的任务图

代理不缺数学,缺的是记性和分工。

最早几次尝试的死法都一样:代理很快「丢失项目状态、停止有效协作」。你别看它一个人做题挺灵,几十个一起干,谁证到哪了、哪条能复用,没两天就乱成一锅粥。救场的是 Prove2Me,Peng 和哥大合作者做的开放协作形式化平台。

旧办法

每个代理自己记着项目全貌,靠上下文撑。上下文一满就忘,忘了就重做或停摆。

新办法

平台维护一张定理陈述的有向无环图,代理照图挑下一条证什么;定理陈述与证明分文件存,Lean 编译更快;每条定理配一句自然语言描述,方便搜索复用。

这东西工地上叫施工进度表:谁也不用把整栋楼记在脑子里,看表干活就行。HN 上有人挑刺说「最终还是靠人类造的工具」,这话没错。锤子也是人造的。

3验收

对不对,机器说了算:Buzzard 亲自跑了一遍,对得上

怀尔斯当年等了两年,这份当天就有人复核完。

可信度看三样。证明只用 Lean 三条标准公理,没偷塞新公理;官方 comparator 工具确认最后证出的那句话跟 Mathlib 自己的费马大定理表述是同一句,防的是「证了个长得像的东西」;Kevin Buzzard,帝国理工的教授、2024 年起领着社区做 FLT 形式化的那位,当天把 1340 万行拉下来在 96 核机器上编译了一遍,耗时约为 Mathlib 的 20 倍,comparator 也跑了,结论大意:对得上。HN 有人担心 13M 行里藏着钻 Lean 漏洞的招,这一遍复核就是回答之一。

再看人核一份证明要多久。1993 年 6 月怀尔斯在三场讲座里宣布证明,两个月后一位审稿人的提问暴露出关键缺口,补了一年,最后和学生 Richard Taylor 一起堵上,1995 年 5 月发表 129 页正确版本。

怀尔斯 FLT,1993 起
约 2 年
Hales 开普勒猜想,1998 起
4 年
Perelman 庞加莱猜想,2002 起
约 4 年
Helfgott 弱哥德巴赫,2013 起
13 年,仍在评审
Claude 代理形式化 FLT
11 天

人核时长按 Anthropic 博文脚注整理;Hales 的 12 人评审组审了 4 年只敢说「99% 确定」。11 天量的是形式化已知证明,不算发现。

对不对,机器 11 天答了;为什么对,还是没人读得完Buzzard:数学上几乎没有新东西1993–1995 · 人核2026 · 机核129 页证明1993 年,3 场讲座上宣布审稿人的提问缺口暴露补了 1 年1995 年发表数十个代理+ Prove2Me 的定理 DAG29,500 条中间定理11 天Lean 检查通过只用 3 条公理comparator 确认与 Mathlib 命题一致核对成本验证 ≠ 理解还空着的一层:给人读的动态文档Buzzard 承诺要做 · Anthropic 大概不会做证明流程缺的那一层
来源:Anthropic 研究博客(2026-09-04)与 Kevin Buzzard 博文。机器把核对已知证明的成本压到了 11 天,但给人看的那份文档,还没人动笔。
4分家

对不对与为什么对,这回头一次分了家

Buzzard 的博文标题是《FLT:Anthropic 抢在我前头了》,正文却没多少酸味。

他说得很直白,大意是:数学上这项工作几乎没告诉我们任何新东西。他早就 99.9% 确信怀尔斯的证明没问题,数论界多数人是 100%;这份形式化忠实跟着早期文献走,走的是 1995 年 Darmon、Diamond、Taylor 的简化阐述路线,不是他正在形式化的现代证明。路线经 Mazur 关于 Eisenstein 理想的工作,只覆盖素数 p≥17,小指数由此前别人已形式化的结果补齐。它真正告诉我们的,是自动形式化现在能做到什么:几千页文献,11 天,端到端。

可这 1340 万行是什么?Anthropic 自己的脚注说体量「可能远比需要的长」。没人读得完,也没打算给人读。Buzzard 向 EPSRC 要那 100 万英镑、5 年的时候,承诺的有两样:一份机器可查的证明,加一份供人类探索现代证明的动态文档。前一样 Anthropic 11 天做完了;后一样,他自己说,Anthropic 大概不会做。

我在外包那些年接过一个政府项目,一个 8 万行的存储过程,注释里留着三任前任的名字,末尾一句「别动第 4720 行」。那玩意儿能跑,跑出来的数也对。可为什么不能动,三个人没一个写下来。我动了,回滚花掉一个通宵。那 8 万行就是一份只有机器读得懂的证明:编译器点头,数字正确,人一句「为什么」都答不上。

核心

1340 万行回答了「费马大定理成立吗」:成立,机器查过。它没回答「为什么成立」,这一层此前是同一份文件里顺带给的,现在得单独有人做。

5懂

讲不清十有八九没真懂,一份只有机器能读的证明算不算知识

刘未鹏《暗时间》里的判断,放这儿正好。

他说「教」是最好的「学」:一件事你讲不清楚,十有八九还没真懂;书写是为了更好的思考,把推理写下来,藏着的前提、假设、逻辑才会被逼到明面上。照这把尺子,1340 万行 Lean 是一份写下来的推理,每一步前提都摊开了。它满足了「书写」,却跳过了「教」:没有一个人能从头跟到尾,也就没有人被它逼着想通什么。

打个比方

一栋楼交付,有两份纸:验收合格证和施工图。合格证告诉你这楼能住,图纸告诉你哪堵是承重墙。以前两份是一伙人出的,现在合格证机器一天开完,图纸没人画。住是能住,哪天想砸墙,你手里只有一张盖了章的合格证。

Buzzard 看重的恰恰是图纸之外的用处。他说这套能力将来能实时形式化前沿研究,让论文评审不那么痛苦,还能「让我们诚实」:那些「专家都知道」、从来没人真写出来的结果,机器会无情地一条条标出来。HN 上另一个担心也成立:公认为真的证明,有多少会被翻出来是错的。

⚡

为什么值得看:「对」从此可以廉价批发,「懂」还是老价钱。以后数学家的活可能倒过来:机器负责说对不对,人负责把为什么对写成人读得懂的样子。

6带走

这对你意味着什么:能编译通过的东西,看得懂的人越来越少

你不搞数论,这事也落到你桌上。

AI 写的代码测试全绿、审查全过,跟这 1340 万行是一个路数:对,机器查过;为什么这么写,问一圈没人答得上。收「对不对」的时候,认机器:测试、类型检查、形式化,谁不给面子就认谁。收「为什么对」的时候,只认人写的那份:设计说明、一段能讲给外行听的注释、一份你自己能从头讲到尾的复盘。第二份没人写,第一份再厚也只是一张合格证。

Buzzard 算过账,大意是:我花 5 年 100 万英镑,Anthropic 只花 11 天,但我怀疑他们花的钱更多。钱还不是最贵的那一栏。他那份给人看的动态文档,眼下还是没人替他做。

取材声明:本文思想框架取材自刘未鹏《暗时间》(教是最好的学、讲不清十有八九没真懂、书写是为了更好的思考);事件与数字出自 Anthropic 研究博客《Formalizing Fermat's Last Theorem》(2026 年 9 月 4 日)、Kevin Buzzard 同日博文《FLT: Anthropic has beaten me to it》及 Hacker News 公开讨论,英文引述为中文大意,费用系网友估算,以原始研究为准。本文为技术科普解读。

テクノロジー

费马大定理 11 天被机器核完:1340 万行 Lean 只回答了『对不对』,没回答『为什么对』

2026年9月5日 · 刘未鹏《暗时间》約 6 分

1637 年费马在书页边上写:我有一个奇妙的证明,可惜页边太窄写不下。2026 年 9 月 4 日,几十个 Claude 代理替他交了一份:1340 万行 Lean 代码,机器检查通过。页边这回够宽了,轮到人这辈子读不完。

30 秒读懂
1作业

11 天、1340 万行、六十亿 token,机器交上来的作业长这样

先把数摆齐,再谈它值不值。

发起人是 Anthropic 研究员 Tianyi Peng,他在哥伦比亚大学的团队做 AI 形式化工具。这回用 Claude Code 的多代理框架,跑一个「大致相当于 Claude Fable 5.1」的内部通用研究模型。人类的数学输入只有 Peng 偶尔几句高层指示,比如「Jacobian 优先当 scheme 处理」「尽快把 Mazur 定理推完」。

指标数字
Lean 代码1340 万行(Buzzard 编译实测 13.4M 行以上)
证出的定理30,300 条,最终用到 29,500 条
体量对比约为 Mathlib(Lean 社区主数学库)的 5 倍
输出 token约 60 亿
早期失败尝试的残留约占最终证明非样板行的 7%
费用没有官方数。Hacker News 上有人按每百万输出 token 50 美元估,约 30 万美元,这是网友估算,不是账单。
2翻车

头几回全垮了,救场的是一张专门给机器看的任务图

代理不缺数学,缺的是记性和分工。

最早几次尝试的死法都一样:代理很快「丢失项目状态、停止有效协作」。你别看它一个人做题挺灵,几十个一起干,谁证到哪了、哪条能复用,没两天就乱成一锅粥。救场的是 Prove2Me,Peng 和哥大合作者做的开放协作形式化平台。

旧办法

每个代理自己记着项目全貌,靠上下文撑。上下文一满就忘,忘了就重做或停摆。

新办法

平台维护一张定理陈述的有向无环图,代理照图挑下一条证什么;定理陈述与证明分文件存,Lean 编译更快;每条定理配一句自然语言描述,方便搜索复用。

这东西工地上叫施工进度表:谁也不用把整栋楼记在脑子里,看表干活就行。HN 上有人挑刺说「最终还是靠人类造的工具」,这话没错。锤子也是人造的。

3验收

对不对,机器说了算:Buzzard 亲自跑了一遍,对得上

怀尔斯当年等了两年,这份当天就有人复核完。

可信度看三样。证明只用 Lean 三条标准公理,没偷塞新公理;官方 comparator 工具确认最后证出的那句话跟 Mathlib 自己的费马大定理表述是同一句,防的是「证了个长得像的东西」;Kevin Buzzard,帝国理工的教授、2024 年起领着社区做 FLT 形式化的那位,当天把 1340 万行拉下来在 96 核机器上编译了一遍,耗时约为 Mathlib 的 20 倍,comparator 也跑了,结论大意:对得上。HN 有人担心 13M 行里藏着钻 Lean 漏洞的招,这一遍复核就是回答之一。

再看人核一份证明要多久。1993 年 6 月怀尔斯在三场讲座里宣布证明,两个月后一位审稿人的提问暴露出关键缺口,补了一年,最后和学生 Richard Taylor 一起堵上,1995 年 5 月发表 129 页正确版本。

怀尔斯 FLT,1993 起
约 2 年
Hales 开普勒猜想,1998 起
4 年
Perelman 庞加莱猜想,2002 起
约 4 年
Helfgott 弱哥德巴赫,2013 起
13 年,仍在评审
Claude 代理形式化 FLT
11 天

人核时长按 Anthropic 博文脚注整理;Hales 的 12 人评审组审了 4 年只敢说「99% 确定」。11 天量的是形式化已知证明,不算发现。

正しいかは機械が 11 日で答えた。なぜ正しいかは、まだ誰も読み切れないBuzzard:数学的に新しいものはほぼない1993–1995 · 人間コア2026 · 機械コア129 ページの証明1993 年、3 回の講演で発表査読者の問い穴が露呈する1 年かけて補修1995 年に発表数十のエージェント+ Prove2Me の定理 DAG中間定理 29,500 本11 日間でLean 検査を通過公理は 3 つだけcomparator が Mathlib の命題と一致を確認検証コスト検証 ≠ 理解まだ空いている層:人が読むための動的文書Buzzard は書くと約束 · Anthropic はおそらく書かない証明の流れ欠けている層
出典:Anthropic 研究ブログ(2026-09-04)と Kevin Buzzard のブログ。機械は既知の証明の検証コストを 11 日まで縮めたが、人が読むための文書はまだ誰も書いていない。数値は元の研究に準じる。
4分家

对不对与为什么对,这回头一次分了家

Buzzard 的博文标题是《FLT:Anthropic 抢在我前头了》,正文却没多少酸味。

他说得很直白,大意是:数学上这项工作几乎没告诉我们任何新东西。他早就 99.9% 确信怀尔斯的证明没问题,数论界多数人是 100%;这份形式化忠实跟着早期文献走,走的是 1995 年 Darmon、Diamond、Taylor 的简化阐述路线,不是他正在形式化的现代证明。路线经 Mazur 关于 Eisenstein 理想的工作,只覆盖素数 p≥17,小指数由此前别人已形式化的结果补齐。它真正告诉我们的,是自动形式化现在能做到什么:几千页文献,11 天,端到端。

可这 1340 万行是什么?Anthropic 自己的脚注说体量「可能远比需要的长」。没人读得完,也没打算给人读。Buzzard 向 EPSRC 要那 100 万英镑、5 年的时候,承诺的有两样:一份机器可查的证明,加一份供人类探索现代证明的动态文档。前一样 Anthropic 11 天做完了;后一样,他自己说,Anthropic 大概不会做。

我在外包那些年接过一个政府项目,一个 8 万行的存储过程,注释里留着三任前任的名字,末尾一句「别动第 4720 行」。那玩意儿能跑,跑出来的数也对。可为什么不能动,三个人没一个写下来。我动了,回滚花掉一个通宵。那 8 万行就是一份只有机器读得懂的证明:编译器点头,数字正确,人一句「为什么」都答不上。

核心

1340 万行回答了「费马大定理成立吗」:成立,机器查过。它没回答「为什么成立」,这一层此前是同一份文件里顺带给的,现在得单独有人做。

5懂

讲不清十有八九没真懂,一份只有机器能读的证明算不算知识

刘未鹏《暗时间》里的判断,放这儿正好。

他说「教」是最好的「学」:一件事你讲不清楚,十有八九还没真懂;书写是为了更好的思考,把推理写下来,藏着的前提、假设、逻辑才会被逼到明面上。照这把尺子,1340 万行 Lean 是一份写下来的推理,每一步前提都摊开了。它满足了「书写」,却跳过了「教」:没有一个人能从头跟到尾,也就没有人被它逼着想通什么。

打个比方

一栋楼交付,有两份纸:验收合格证和施工图。合格证告诉你这楼能住,图纸告诉你哪堵是承重墙。以前两份是一伙人出的,现在合格证机器一天开完,图纸没人画。住是能住,哪天想砸墙,你手里只有一张盖了章的合格证。

Buzzard 看重的恰恰是图纸之外的用处。他说这套能力将来能实时形式化前沿研究,让论文评审不那么痛苦,还能「让我们诚实」:那些「专家都知道」、从来没人真写出来的结果,机器会无情地一条条标出来。HN 上另一个担心也成立:公认为真的证明,有多少会被翻出来是错的。

⚡

为什么值得看:「对」从此可以廉价批发,「懂」还是老价钱。以后数学家的活可能倒过来:机器负责说对不对,人负责把为什么对写成人读得懂的样子。

6带走

这对你意味着什么:能编译通过的东西,看得懂的人越来越少

你不搞数论,这事也落到你桌上。

AI 写的代码测试全绿、审查全过,跟这 1340 万行是一个路数:对,机器查过;为什么这么写,问一圈没人答得上。收「对不对」的时候,认机器:测试、类型检查、形式化,谁不给面子就认谁。收「为什么对」的时候,只认人写的那份:设计说明、一段能讲给外行听的注释、一份你自己能从头讲到尾的复盘。第二份没人写,第一份再厚也只是一张合格证。

Buzzard 算过账,大意是:我花 5 年 100 万英镑,Anthropic 只花 11 天,但我怀疑他们花的钱更多。钱还不是最贵的那一栏。他那份给人看的动态文档,眼下还是没人替他做。

取材声明:本文思想框架取材自刘未鹏《暗时间》(教是最好的学、讲不清十有八九没真懂、书写是为了更好的思考);事件与数字出自 Anthropic 研究博客《Formalizing Fermat's Last Theorem》(2026 年 9 月 4 日)、Kevin Buzzard 同日博文《FLT: Anthropic has beaten me to it》及 Hacker News 公开讨论,英文引述为中文大意,费用系网友估算,以原始研究为准。本文为技术科普解读。