vlog
← 返回全部文章

Tech

AI 编程的对照组正在灭绝

2026年7月14日 · 老陈,凯文·凯利《失控》~1 min read

2026 年 2 月,一家专门研究 AI 的机构 METR 想把去年那个实验再跑一遍——就是测"AI 到底让程序员快了还是慢了"的那个。结果卡在了第一步:招不到人。不是没人报名,是没人肯为了做实验,把 AI 从自己的活儿里拿掉,哪怕就一天。你品品这事:我们连"关掉 AI 干一天活"都做不到了。那道用来量它到底顶不顶用的尺子,正在我们手里化掉。

30 秒读懂
1招不到人

一个实验做不下去了,因为没人肯关掉 AI 干一天活

实验黄了,比实验结果更值得琢磨。

METR 这机构,2025 年做过一个挺有名的实验:找一批熟手开发者,让他们干真实的活,测 AI 助手到底帮了多少忙。2026 年 2 月,他们想再跑一遍,看看一年过去情况变没变。招募环节就卡住了——开发者拒绝参加。不是嫌钱少、嫌麻烦,是因为实验设计里有一环得让一部分人不用 AI 写代码,而这些人连为了做实验、就那么点时间,都不肯把 AI 关掉。

你先别急着笑他们矫情。这事儿说白了,就是工具已经长进手里了。就像你用惯了电动螺丝刀,突然让你为了"做个对照实验"改回手拧一整天,你也别扭——手拧本来就是能拧的,可你身体已经不答应了。区别在于:螺丝拧没拧紧,你当场就知道。代码这活儿,AI 顶没顶用,你得靠比。而"比"这件事,正是从招不到人那一刻起,塌了半边。

为什么值得看:一个实验招不到对照组,本身就是一条结论——它说明依赖已经深到,我们连"暂时不依赖"都做不到了。而做不到"不依赖",就意味着我们没法再客观地量它。

2对照组

没有"不用 AI 的那一组",你就没有量它的那把尺子

对照组不是实验的配角,是那根基准线本身。

做过一点科学的人都懂一个最土的道理:想知道一种药灵不灵,你不能光看吃药的人好没好,你得留一组不吃药的,两边一比才算数。那组不吃药的,就叫对照组。它平时不起眼,可少了它,"好转"这两个字就没了参照——人是自己好的,还是药治好的,你根本分不清。

凯文·凯利在《失控》里讲过一个更狠的道理。一个系统一旦复杂到你没法再站到它外面去看,你就同时丢了两样东西:一是上帝视角,二是衡量它的基准线。"人不靠 AI 写代码"就是软件这行的那条基准线——它是那组不吃药的人。现在这组人正在灭绝:招不到、留不住,连他们自己都不肯当那组人了。基准线一没,你手里就剩一堆"感觉":感觉快了、感觉爽了、感觉离不开了。可感觉这东西,最会骗人。

要多会骗?看 2025 年 METR 那次实测就知道了:开发者自我感觉用了 AI 快了大约 20%,秒表却记着他们实际慢了约 19%。感觉和事实,差了将近 40 个点,方向还是反的。而现在的麻烦是——我们连再架一次秒表的机会,都快没有了。

能测量的世界

有一组人不用 AI,两边一比,快没快、值不值,秤上见真章。这是 2025 年 METR 还测得动的世界。

测不了的世界

人人都用 AI,没人肯当对照组,基准线灭绝。剩下的只有"感觉离不开",量不出到底顶不顶用。

对照组一没,量它的尺子就没了能测量的世界对照组有一群人不用 AI两边一比秤上见真章,答案是实的METR 2025:自感快约 20%,实测慢约 19%测不了的世界人人都用 AI没人肯当那组对照基准线灭绝只剩感觉,量不出数字METR 2026:重跑被拒——招不到人肯关掉 AI尺子丢了一旦你没法站到系统外面,就同时丢了上帝视角,也丢了衡量它的基准线。可测量的对比基准线丢失
来源:TechCrunch《Coders are refusing to work without AI》(2026-05-29);METR 2025 生产力实验。当没人肯为做实验而关掉 AI,对照组就消失了——那条曾告诉我们"它到底值不值"的基准线,也跟着一起没了。框架:凯文·凯利《失控》。
3没量到的账

没了尺子,账就只能靠拍脑袋——而拍出来的数不太好看

凑巧现在有几家把账翻开摆了摆,画面不算体面。

尺子丢了,最直接的后果是花钱没个准。Uber 就是个现成的例子:2026 年头 4 个月,它就把一整年的 AI 预算烧穿了。COO Andrew Macdonald 的原话是,这些钱并没有带来可测量的项目或生产力提升。注意是"可测量"——不是他觉得没用,是他压根没法量出有用。这不就是没对照组的活报应?钱哗哗地流,产出多没多,账上算不出来。

更扎心的是钱花在了哪。Entelligence AI 有个数据:企业里大约 44% 的 AI token,是花在修 AI 自己引入的 bug 上的。你没看错——将近一半的力气,是在给它擦屁股。CodeRabbit 分析得更直白:AI 生成的代码,比人写的多出大约 1.7 倍的问题。这两个数摆一块,那点"生成得飞快"的爽感,得先扣掉一大截。

token 花在修 AI 自己的 bug
44%
AI 代码比人写的多出的问题
1.7×

口径:44% 来自 Entelligence AI;1.7 倍来自 CodeRabbit 分析(条长为便于比较的示意,非等比)。

你别看这些数字各说各的,其实指同一件事:账没人认真算过。生成快得像变魔术,可修 bug、来回审、返工那些活儿,没人拿尺子量,就当它不存在。业界有句话把这层意思钉死了——"依赖已经跑赢了证据"。说白了:我们离不开它的速度,比我们证明它有用的速度,快太多了。

核心

危险的不是 AI 让你——慢了还测得出来、改得回来。危险的是我们快要没法测了,从此只能凭感觉花钱、凭感觉信它。

4这对你意味着什么

你未必能救回全行业的对照组,但你能给自己留一根基准线

大账算不清,小账你还算得清——前提是你舍得花那点力气留个对照。

先说清楚,这篇不是劝你别用 AI,回去自己一行行敲。速度是真的,好用也是真的,我自己天天用。问题从来不在工具,在我们把"感觉离不开"当成了"确实划算",中间那道验证的坎,悄悄就跳过去了。METR 招不到人这事,是整个行业的对照组在灭绝;但你自己那台机器上的基准线,还捏在你手里,就看你舍不舍得留。

三件今天就能干的实在事。第一,隔段时间挑个小活,故意关掉 AI 从头做一遍,掐个表——给自己留一组"不吃药的",好知道那个"快"是真快还是错觉。第二,把返工记进账,别只盯着"生成用了几秒",修 bug、来回审、两周内又删掉的时间都算上;44% 那个数不是别人家的事,是提醒你自己那本账很可能也漏了一大块。第三,凡是重要的活,至少留一个从头真正搞懂它的人。这人不是绊脚石,是你和"这段东西靠不靠谱"之间的那根线;线一断,出了事手里就是一堆没人敢拍板的代码。

说到底,尺子这东西,丢起来无声无息,等你想量的时候才发现早没了。凯文·凯利那句话反过来听更提神:你越是没法站到系统外面,就越该主动给自己留个能站出来的位置。那位置不值钱,就是隔三差五关掉 AI 干一天活的那点别扭。图啥?图哪天你想知道它到底值不值的时候,手里还有一把秤,而不是只剩一句"反正离不开了"。

取材:凯文·凯利《失控》(复杂系统失去外部视角与基准线的思想);新闻据 TechCrunch《Coders are refusing to work without AI》(2026-05-29)、The Next Web、ACM《The End of the Coder?》,以及 METR、Uber、Entelligence AI、CodeRabbit 相关报道,数字以原报道为准。本文为基于经典书籍的科普解读,非专业建议。

技术

AI 编程的对照组正在灭绝

2026年7月14日 · 老陈,凯文·凯利《失控》约 6 分钟

2026 年 2 月,一家专门研究 AI 的机构 METR 想把去年那个实验再跑一遍——就是测"AI 到底让程序员快了还是慢了"的那个。结果卡在了第一步:招不到人。不是没人报名,是没人肯为了做实验,把 AI 从自己的活儿里拿掉,哪怕就一天。你品品这事:我们连"关掉 AI 干一天活"都做不到了。那道用来量它到底顶不顶用的尺子,正在我们手里化掉。

30 秒读懂
1招不到人

一个实验做不下去了,因为没人肯关掉 AI 干一天活

实验黄了,比实验结果更值得琢磨。

METR 这机构,2025 年做过一个挺有名的实验:找一批熟手开发者,让他们干真实的活,测 AI 助手到底帮了多少忙。2026 年 2 月,他们想再跑一遍,看看一年过去情况变没变。招募环节就卡住了——开发者拒绝参加。不是嫌钱少、嫌麻烦,是因为实验设计里有一环得让一部分人不用 AI 写代码,而这些人连为了做实验、就那么点时间,都不肯把 AI 关掉。

你先别急着笑他们矫情。这事儿说白了,就是工具已经长进手里了。就像你用惯了电动螺丝刀,突然让你为了"做个对照实验"改回手拧一整天,你也别扭——手拧本来就是能拧的,可你身体已经不答应了。区别在于:螺丝拧没拧紧,你当场就知道。代码这活儿,AI 顶没顶用,你得靠比。而"比"这件事,正是从招不到人那一刻起,塌了半边。

为什么值得看:一个实验招不到对照组,本身就是一条结论——它说明依赖已经深到,我们连"暂时不依赖"都做不到了。而做不到"不依赖",就意味着我们没法再客观地量它。

2对照组

没有"不用 AI 的那一组",你就没有量它的那把尺子

对照组不是实验的配角,是那根基准线本身。

做过一点科学的人都懂一个最土的道理:想知道一种药灵不灵,你不能光看吃药的人好没好,你得留一组不吃药的,两边一比才算数。那组不吃药的,就叫对照组。它平时不起眼,可少了它,"好转"这两个字就没了参照——人是自己好的,还是药治好的,你根本分不清。

凯文·凯利在《失控》里讲过一个更狠的道理。一个系统一旦复杂到你没法再站到它外面去看,你就同时丢了两样东西:一是上帝视角,二是衡量它的基准线。"人不靠 AI 写代码"就是软件这行的那条基准线——它是那组不吃药的人。现在这组人正在灭绝:招不到、留不住,连他们自己都不肯当那组人了。基准线一没,你手里就剩一堆"感觉":感觉快了、感觉爽了、感觉离不开了。可感觉这东西,最会骗人。

要多会骗?看 2025 年 METR 那次实测就知道了:开发者自我感觉用了 AI 快了大约 20%,秒表却记着他们实际慢了约 19%。感觉和事实,差了将近 40 个点,方向还是反的。而现在的麻烦是——我们连再架一次秒表的机会,都快没有了。

能测量的世界

有一组人不用 AI,两边一比,快没快、值不值,秤上见真章。这是 2025 年 METR 还测得动的世界。

测不了的世界

人人都用 AI,没人肯当对照组,基准线灭绝。剩下的只有"感觉离不开",量不出到底顶不顶用。

对照组一没,量它的尺子就没了能测量的世界对照组有一群人不用 AI两边一比秤上见真章,答案是实的METR 2025:自感快约 20%,实测慢约 19%测不了的世界人人都用 AI没人肯当那组对照基准线灭绝只剩感觉,量不出数字METR 2026:重跑被拒——招不到人肯关掉 AI尺子丢了一旦你没法站到系统外面,就同时丢了上帝视角,也丢了衡量它的基准线。可测量的对比基准线丢失
来源:TechCrunch《Coders are refusing to work without AI》(2026-05-29);METR 2025 生产力实验。当没人肯为做实验而关掉 AI,对照组就消失了——那条曾告诉我们"它到底值不值"的基准线,也跟着一起没了。框架:凯文·凯利《失控》。
3没量到的账

没了尺子,账就只能靠拍脑袋——而拍出来的数不太好看

凑巧现在有几家把账翻开摆了摆,画面不算体面。

尺子丢了,最直接的后果是花钱没个准。Uber 就是个现成的例子:2026 年头 4 个月,它就把一整年的 AI 预算烧穿了。COO Andrew Macdonald 的原话是,这些钱并没有带来可测量的项目或生产力提升。注意是"可测量"——不是他觉得没用,是他压根没法量出有用。这不就是没对照组的活报应?钱哗哗地流,产出多没多,账上算不出来。

更扎心的是钱花在了哪。Entelligence AI 有个数据:企业里大约 44% 的 AI token,是花在修 AI 自己引入的 bug 上的。你没看错——将近一半的力气,是在给它擦屁股。CodeRabbit 分析得更直白:AI 生成的代码,比人写的多出大约 1.7 倍的问题。这两个数摆一块,那点"生成得飞快"的爽感,得先扣掉一大截。

token 花在修 AI 自己的 bug
44%
AI 代码比人写的多出的问题
1.7×

口径:44% 来自 Entelligence AI;1.7 倍来自 CodeRabbit 分析(条长为便于比较的示意,非等比)。

你别看这些数字各说各的,其实指同一件事:账没人认真算过。生成快得像变魔术,可修 bug、来回审、返工那些活儿,没人拿尺子量,就当它不存在。业界有句话把这层意思钉死了——"依赖已经跑赢了证据"。说白了:我们离不开它的速度,比我们证明它有用的速度,快太多了。

核心

危险的不是 AI 让你——慢了还测得出来、改得回来。危险的是我们快要没法测了,从此只能凭感觉花钱、凭感觉信它。

4这对你意味着什么

你未必能救回全行业的对照组,但你能给自己留一根基准线

大账算不清,小账你还算得清——前提是你舍得花那点力气留个对照。

先说清楚,这篇不是劝你别用 AI,回去自己一行行敲。速度是真的,好用也是真的,我自己天天用。问题从来不在工具,在我们把"感觉离不开"当成了"确实划算",中间那道验证的坎,悄悄就跳过去了。METR 招不到人这事,是整个行业的对照组在灭绝;但你自己那台机器上的基准线,还捏在你手里,就看你舍不舍得留。

三件今天就能干的实在事。第一,隔段时间挑个小活,故意关掉 AI 从头做一遍,掐个表——给自己留一组"不吃药的",好知道那个"快"是真快还是错觉。第二,把返工记进账,别只盯着"生成用了几秒",修 bug、来回审、两周内又删掉的时间都算上;44% 那个数不是别人家的事,是提醒你自己那本账很可能也漏了一大块。第三,凡是重要的活,至少留一个从头真正搞懂它的人。这人不是绊脚石,是你和"这段东西靠不靠谱"之间的那根线;线一断,出了事手里就是一堆没人敢拍板的代码。

说到底,尺子这东西,丢起来无声无息,等你想量的时候才发现早没了。凯文·凯利那句话反过来听更提神:你越是没法站到系统外面,就越该主动给自己留个能站出来的位置。那位置不值钱,就是隔三差五关掉 AI 干一天活的那点别扭。图啥?图哪天你想知道它到底值不值的时候,手里还有一把秤,而不是只剩一句"反正离不开了"。

取材:凯文·凯利《失控》(复杂系统失去外部视角与基准线的思想);新闻据 TechCrunch《Coders are refusing to work without AI》(2026-05-29)、The Next Web、ACM《The End of the Coder?》,以及 METR、Uber、Entelligence AI、CodeRabbit 相关报道,数字以原报道为准。本文为基于经典书籍的科普解读,非专业建议。

テクノロジー

AI 编程的对照组正在灭绝

2026年7月14日 · 老陈,凯文·凯利《失控》約 6 分

2026 年 2 月,一家专门研究 AI 的机构 METR 想把去年那个实验再跑一遍——就是测"AI 到底让程序员快了还是慢了"的那个。结果卡在了第一步:招不到人。不是没人报名,是没人肯为了做实验,把 AI 从自己的活儿里拿掉,哪怕就一天。你品品这事:我们连"关掉 AI 干一天活"都做不到了。那道用来量它到底顶不顶用的尺子,正在我们手里化掉。

30 秒读懂
1招不到人

一个实验做不下去了,因为没人肯关掉 AI 干一天活

实验黄了,比实验结果更值得琢磨。

METR 这机构,2025 年做过一个挺有名的实验:找一批熟手开发者,让他们干真实的活,测 AI 助手到底帮了多少忙。2026 年 2 月,他们想再跑一遍,看看一年过去情况变没变。招募环节就卡住了——开发者拒绝参加。不是嫌钱少、嫌麻烦,是因为实验设计里有一环得让一部分人不用 AI 写代码,而这些人连为了做实验、就那么点时间,都不肯把 AI 关掉。

你先别急着笑他们矫情。这事儿说白了,就是工具已经长进手里了。就像你用惯了电动螺丝刀,突然让你为了"做个对照实验"改回手拧一整天,你也别扭——手拧本来就是能拧的,可你身体已经不答应了。区别在于:螺丝拧没拧紧,你当场就知道。代码这活儿,AI 顶没顶用,你得靠比。而"比"这件事,正是从招不到人那一刻起,塌了半边。

为什么值得看:一个实验招不到对照组,本身就是一条结论——它说明依赖已经深到,我们连"暂时不依赖"都做不到了。而做不到"不依赖",就意味着我们没法再客观地量它。

2对照组

没有"不用 AI 的那一组",你就没有量它的那把尺子

对照组不是实验的配角,是那根基准线本身。

做过一点科学的人都懂一个最土的道理:想知道一种药灵不灵,你不能光看吃药的人好没好,你得留一组不吃药的,两边一比才算数。那组不吃药的,就叫对照组。它平时不起眼,可少了它,"好转"这两个字就没了参照——人是自己好的,还是药治好的,你根本分不清。

凯文·凯利在《失控》里讲过一个更狠的道理。一个系统一旦复杂到你没法再站到它外面去看,你就同时丢了两样东西:一是上帝视角,二是衡量它的基准线。"人不靠 AI 写代码"就是软件这行的那条基准线——它是那组不吃药的人。现在这组人正在灭绝:招不到、留不住,连他们自己都不肯当那组人了。基准线一没,你手里就剩一堆"感觉":感觉快了、感觉爽了、感觉离不开了。可感觉这东西,最会骗人。

要多会骗?看 2025 年 METR 那次实测就知道了:开发者自我感觉用了 AI 快了大约 20%,秒表却记着他们实际慢了约 19%。感觉和事实,差了将近 40 个点,方向还是反的。而现在的麻烦是——我们连再架一次秒表的机会,都快没有了。

能测量的世界

有一组人不用 AI,两边一比,快没快、值不值,秤上见真章。这是 2025 年 METR 还测得动的世界。

测不了的世界

人人都用 AI,没人肯当对照组,基准线灭绝。剩下的只有"感觉离不开",量不出到底顶不顶用。

对照组一没,量它的尺子就没了能测量的世界对照组有一群人不用 AI两边一比秤上见真章,答案是实的METR 2025:自感快约 20%,实测慢约 19%测不了的世界人人都用 AI没人肯当那组对照基准线灭绝只剩感觉,量不出数字METR 2026:重跑被拒——招不到人肯关掉 AI尺子丢了一旦你没法站到系统外面,就同时丢了上帝视角,也丢了衡量它的基准线。可测量的对比基准线丢失
来源:TechCrunch《Coders are refusing to work without AI》(2026-05-29);METR 2025 生产力实验。当没人肯为做实验而关掉 AI,对照组就消失了——那条曾告诉我们"它到底值不值"的基准线,也跟着一起没了。框架:凯文·凯利《失控》。
3没量到的账

没了尺子,账就只能靠拍脑袋——而拍出来的数不太好看

凑巧现在有几家把账翻开摆了摆,画面不算体面。

尺子丢了,最直接的后果是花钱没个准。Uber 就是个现成的例子:2026 年头 4 个月,它就把一整年的 AI 预算烧穿了。COO Andrew Macdonald 的原话是,这些钱并没有带来可测量的项目或生产力提升。注意是"可测量"——不是他觉得没用,是他压根没法量出有用。这不就是没对照组的活报应?钱哗哗地流,产出多没多,账上算不出来。

更扎心的是钱花在了哪。Entelligence AI 有个数据:企业里大约 44% 的 AI token,是花在修 AI 自己引入的 bug 上的。你没看错——将近一半的力气,是在给它擦屁股。CodeRabbit 分析得更直白:AI 生成的代码,比人写的多出大约 1.7 倍的问题。这两个数摆一块,那点"生成得飞快"的爽感,得先扣掉一大截。

token 花在修 AI 自己的 bug
44%
AI 代码比人写的多出的问题
1.7×

口径:44% 来自 Entelligence AI;1.7 倍来自 CodeRabbit 分析(条长为便于比较的示意,非等比)。

你别看这些数字各说各的,其实指同一件事:账没人认真算过。生成快得像变魔术,可修 bug、来回审、返工那些活儿,没人拿尺子量,就当它不存在。业界有句话把这层意思钉死了——"依赖已经跑赢了证据"。说白了:我们离不开它的速度,比我们证明它有用的速度,快太多了。

核心

危险的不是 AI 让你——慢了还测得出来、改得回来。危险的是我们快要没法测了,从此只能凭感觉花钱、凭感觉信它。

4这对你意味着什么

你未必能救回全行业的对照组,但你能给自己留一根基准线

大账算不清,小账你还算得清——前提是你舍得花那点力气留个对照。

先说清楚,这篇不是劝你别用 AI,回去自己一行行敲。速度是真的,好用也是真的,我自己天天用。问题从来不在工具,在我们把"感觉离不开"当成了"确实划算",中间那道验证的坎,悄悄就跳过去了。METR 招不到人这事,是整个行业的对照组在灭绝;但你自己那台机器上的基准线,还捏在你手里,就看你舍不舍得留。

三件今天就能干的实在事。第一,隔段时间挑个小活,故意关掉 AI 从头做一遍,掐个表——给自己留一组"不吃药的",好知道那个"快"是真快还是错觉。第二,把返工记进账,别只盯着"生成用了几秒",修 bug、来回审、两周内又删掉的时间都算上;44% 那个数不是别人家的事,是提醒你自己那本账很可能也漏了一大块。第三,凡是重要的活,至少留一个从头真正搞懂它的人。这人不是绊脚石,是你和"这段东西靠不靠谱"之间的那根线;线一断,出了事手里就是一堆没人敢拍板的代码。

说到底,尺子这东西,丢起来无声无息,等你想量的时候才发现早没了。凯文·凯利那句话反过来听更提神:你越是没法站到系统外面,就越该主动给自己留个能站出来的位置。那位置不值钱,就是隔三差五关掉 AI 干一天活的那点别扭。图啥?图哪天你想知道它到底值不值的时候,手里还有一把秤,而不是只剩一句"反正离不开了"。

取材:凯文·凯利《失控》(复杂系统失去外部视角与基准线的思想);新闻据 TechCrunch《Coders are refusing to work without AI》(2026-05-29)、The Next Web、ACM《The End of the Coder?》,以及 METR、Uber、Entelligence AI、CodeRabbit 相关报道,数字以原报道为准。本文为基于经典书籍的科普解读,非专业建议。