vlog
← 返回全部文章

Tech

1,053 名开发者面前摆着一条危险命令,只有 13.6% 的人把它拦下了

2026年8月15日 · 凯文·凯利《失控》~1 min read

1,053 名开发者,面对同一个危险动作,只有 13.6% 的人按了拒绝。剩下那些人多半不是没看见,是看了一眼就点了同意。2026 年 8 月 14 日起,Claude Code 的 auto mode 成了 Pro、Max、Team 计划新会话的默认档,替他们点同意的换成了一个分类器。你可以骂这是越权,也可以先算笔账:那道被顶掉的弹窗,这些年究竟拦下过什么。

30 秒读懂
1默认值

这次动的是默认值,而默认值决定了绝大多数人实际怎么用

能力早就在那儿,改的是那个开关的初始位置。

从 2026 年 8 月 14 日起,Pro、Max、Team 计划的用户新开一个 Claude Code 会话,auto mode 就是默认档;Enterprise 与 API 用户初期仍是选择性开启。做过产品的都清楚默认值的分量:设置页里那几十个开关,绝大多数人一辈子也不会翻一遍。改一个默认值,等于替所有没翻过设置页的人把决定做了,这个量级比多给一个选项大得多。

被换掉的那个动作,过去两年每个用 agent 写代码的人每天要做几十遍:跳出一个框,问你这条命令能不能执行,你按同意,它接着跑。现在这一步由分类器接手,它判断动作危不危险,危险的那些才停下来问人。

开发者对权限弹窗的通过率
97%
分类器对同批危险动作的拦截率
89%
1,053 名开发者中拒绝该危险动作的比例
13.6%

口径:三个数字分别出自 Anthropic 的公开说明与那项对照研究,样本与测量场景不同,不能直接相减。

2通过率

97% 和 13.6% 讲的是同一件事:那道弹窗早就不产生审查了

把这两个数摆一块看,结论有点难堪。

97% 的通过率意味着,一百次弹窗里有九十七次的答案在框跳出来之前就定了。1,053 人那项研究把这事测得更狠:动作是危险的,明摆在眼前,仍然只有 13.6% 的人按了拒绝。人不是变笨了,是频率把审查这件事碾平了——一小时几十次的确认,第五次之后,眼睛就只认按钮位置,不认框里的字了。

这套东西我在银行项目上见过实体版。2013 年给华南一家城商行做网银改造,行方所有变更走纸质签批,一式三份、六个章。4 月 17 日那条配置把某档利率的小数点挪了一位,六个章一个不落全盖齐了,照样上了生产,回滚做到凌晨四点,食堂给加班的人煮了两锅面。行里从此把这类事故叫「4·17」。那六个签字的人都不是混子,他们每天要签几十份,看的是编号对不对、格式全不全。章管的是谁负责,不管对不对。

打个比方

大排档老板站在传菜口,每盘菜出锅先尝一口。头十桌他真尝,第五十桌开始,只瞟一眼颜色就挥手放行。真正让这家店不出事的,从来都是另外几样:生熟分开的砧板、过期的料进不了后厨、每桌的单子留底,吃坏了能倒查是哪一锅。传菜口那一口,早就只剩个动作。

3让渡

凯文·凯利在《失控》里给过答案:活系统的秩序,本来就不长在中央那张审批桌上

《失控》整本书都在琢磨一件事:把控制权交出去之后,还剩下什么。

凯利反复拿蜂群、生态、分布式网络说事。一群蜜蜂选新巢,没有哪只蜂拿到过全局图纸,也没有哪只在出发前挨个批准同伴的路线;秩序是在局部规则和边界里长出来的。他拿这个对照人造系统时讲的是同一件事:你想让一个系统又快又大,就得把决定权往下放;放下去之后,上层的活从「逐条同意」改成「定规则、划边界、留退路」。让渡不等于撒手,前提是得换上真正起作用的那种控制。

有人会说,机器批准至少比人快、比人一致。这话没错,可它回答的还是「谁来批」这个老问题。凯利那套东西的重点在另一头:逐条审批的速度一旦跟不上系统的活动量,把它加快一百倍,也只是把橡皮图章盖得更快。中央审批的处理量是有天花板的,agent 的动作量却在往上长,两条线一交叉,中央要么成瓶颈,要么开始盖章。

核心

97% 与 13.6% 是同一个天花板的两面:确认的频率一旦超过人真能审的量,逐条批准就退化成盖章,这跟按同意的是人还是分类器没关系。

HUMANS CAUGHT 13.6% — THE CLASSIFIER CAUGHT 89%BLOCKED · SAME DANGEROUS ACTIONS · 1,053 DEVELOPERSHuman review13.6%auto mode classifier89%EVERYDAY: PERMISSION PROMPTS97%waved through by developers
Source: a 1,053-developer study. The gate was a ritual.
4存疑

Simon Willison 要的那句「更多独立验证」,卡的是两处实打实的空

89% 这个数好看,但它是谁测的、拿什么测的,决定了它值多少。

Willison 的态度偏保留。他说「我希望看到更多独立验证」("I'd like to see more independent confirmation of this"),还提到自己曾公开预测 2026 年会出现「编码智能体安全领域的挑战者号灾难」("a challenger disaster for coding agents security"),他希望这个预测年底之前被证明是错的。第一处空就在这儿:89% 出自厂商自己的测量,被拦下的是研究里那批已知的危险动作,跟你下周真会撞上的那批是不是同一类,眼下没有第三方的账可对。

第二处空是他特别点出来的:第三方恶意软件包里夹带的指令,分类器未必挡得住。这条我有体感。2021 年我一个小工具的构建突然挂了,上游一个 npm 小包的作者删库跑路,打包机上恰好留着缓存才没停摆;从那以后我把整个 node_modules 定期拷进一块移动硬盘,贴纸上写着俩字:别笑。上回是包没了,这回是包还在、里头夹了话。分类器读的是 agent 要执行的动作,而那句怂恿它的话跟着依赖树一起进来,动作本身可以看着规规矩矩。

口径说明:13.6% 与 89% 针对的是同一批危险动作,97% 是 Anthropic 对权限弹窗通过率的另一项表述,三者的样本与场景并不重合。另外,分类器拦下 89%,也意味着剩下 11% 没被拦下,而这一档现在没有人再看第二眼。
5自用

这对你意味着什么:把「逐条批准」的力气,挪到边界、可回滚和事后审计上

弹窗给不了的三样东西,恰好是现在还能自己动手加的。

旧办法

每个动作弹一次框,指望你在几十次确认里挑出危险的那一次;实测下来 97% 直接放行,真危险的那次只有 13.6% 的人拒绝。

新办法

把危险关进边界:agent 只能碰指定的目录、指定的凭据、指定的网络出口。越界的事它压根做不了,也就不必每次问你。

①边界。给 agent 一个专用工作目录和一套权限最小的凭据,容器或独立账号都行,别让它揣着你全套钥匙干活。②可回滚。动手前落一个干净的提交或快照,出事的成本从「查半天」压到「丢十分钟」。③事后审计。auto mode 把决定挪到了机器那边,那就至少让机器的决定留一份能翻的账:什么时候批了什么、拦了什么,事后查得出来。

这三样跟 auto mode 不冲突,凯利那套分层让渡讲的也是这个:上层定边界,底下自己跑。至于那 11% 没被拦下的动作,现在既没有弹窗看着,也还没等到独立验证。在验证到来之前,还留在你手里的控制只有两样:边界画在哪儿,快照存了没有。

本文取材自凯文·凯利《失控》中关于分布式控制与控制权让渡的公开论述,为个人解读。文中数字与人物表态出自 Anthropic 的公开说明、相关对照研究及 Simon Willison 的公开评论,具体以原始来源为准。本文非安全工程建议,生产环境的权限策略请按自身风险评估决定。

技术

1,053 名开发者面前摆着一条危险命令,只有 13.6% 的人把它拦下了

2026年8月15日 · 凯文·凯利《失控》约 6 分钟

1,053 名开发者,面对同一个危险动作,只有 13.6% 的人按了拒绝。剩下那些人多半不是没看见,是看了一眼就点了同意。2026 年 8 月 14 日起,Claude Code 的 auto mode 成了 Pro、Max、Team 计划新会话的默认档,替他们点同意的换成了一个分类器。你可以骂这是越权,也可以先算笔账:那道被顶掉的弹窗,这些年究竟拦下过什么。

30 秒读懂
1默认值

这次动的是默认值,而默认值决定了绝大多数人实际怎么用

能力早就在那儿,改的是那个开关的初始位置。

从 2026 年 8 月 14 日起,Pro、Max、Team 计划的用户新开一个 Claude Code 会话,auto mode 就是默认档;Enterprise 与 API 用户初期仍是选择性开启。做过产品的都清楚默认值的分量:设置页里那几十个开关,绝大多数人一辈子也不会翻一遍。改一个默认值,等于替所有没翻过设置页的人把决定做了,这个量级比多给一个选项大得多。

被换掉的那个动作,过去两年每个用 agent 写代码的人每天要做几十遍:跳出一个框,问你这条命令能不能执行,你按同意,它接着跑。现在这一步由分类器接手,它判断动作危不危险,危险的那些才停下来问人。

开发者对权限弹窗的通过率
97%
分类器对同批危险动作的拦截率
89%
1,053 名开发者中拒绝该危险动作的比例
13.6%

口径:三个数字分别出自 Anthropic 的公开说明与那项对照研究,样本与测量场景不同,不能直接相减。

2通过率

97% 和 13.6% 讲的是同一件事:那道弹窗早就不产生审查了

把这两个数摆一块看,结论有点难堪。

97% 的通过率意味着,一百次弹窗里有九十七次的答案在框跳出来之前就定了。1,053 人那项研究把这事测得更狠:动作是危险的,明摆在眼前,仍然只有 13.6% 的人按了拒绝。人不是变笨了,是频率把审查这件事碾平了——一小时几十次的确认,第五次之后,眼睛就只认按钮位置,不认框里的字了。

这套东西我在银行项目上见过实体版。2013 年给华南一家城商行做网银改造,行方所有变更走纸质签批,一式三份、六个章。4 月 17 日那条配置把某档利率的小数点挪了一位,六个章一个不落全盖齐了,照样上了生产,回滚做到凌晨四点,食堂给加班的人煮了两锅面。行里从此把这类事故叫「4·17」。那六个签字的人都不是混子,他们每天要签几十份,看的是编号对不对、格式全不全。章管的是谁负责,不管对不对。

打个比方

大排档老板站在传菜口,每盘菜出锅先尝一口。头十桌他真尝,第五十桌开始,只瞟一眼颜色就挥手放行。真正让这家店不出事的,从来都是另外几样:生熟分开的砧板、过期的料进不了后厨、每桌的单子留底,吃坏了能倒查是哪一锅。传菜口那一口,早就只剩个动作。

3让渡

凯文·凯利在《失控》里给过答案:活系统的秩序,本来就不长在中央那张审批桌上

《失控》整本书都在琢磨一件事:把控制权交出去之后,还剩下什么。

凯利反复拿蜂群、生态、分布式网络说事。一群蜜蜂选新巢,没有哪只蜂拿到过全局图纸,也没有哪只在出发前挨个批准同伴的路线;秩序是在局部规则和边界里长出来的。他拿这个对照人造系统时讲的是同一件事:你想让一个系统又快又大,就得把决定权往下放;放下去之后,上层的活从「逐条同意」改成「定规则、划边界、留退路」。让渡不等于撒手,前提是得换上真正起作用的那种控制。

有人会说,机器批准至少比人快、比人一致。这话没错,可它回答的还是「谁来批」这个老问题。凯利那套东西的重点在另一头:逐条审批的速度一旦跟不上系统的活动量,把它加快一百倍,也只是把橡皮图章盖得更快。中央审批的处理量是有天花板的,agent 的动作量却在往上长,两条线一交叉,中央要么成瓶颈,要么开始盖章。

核心

97% 与 13.6% 是同一个天花板的两面:确认的频率一旦超过人真能审的量,逐条批准就退化成盖章,这跟按同意的是人还是分类器没关系。

把关的人拦下 13.6%,分类器拦下 89%拦下率 · 同一批危险动作 · 1,053 名开发者人工逐条批准13.6%auto mode 分类器89%日常里的权限弹窗97%被开发者直接放行
来源:1,053 名开发者的对照研究。这道闸早就空了。
4存疑

Simon Willison 要的那句「更多独立验证」,卡的是两处实打实的空

89% 这个数好看,但它是谁测的、拿什么测的,决定了它值多少。

Willison 的态度偏保留。他说「我希望看到更多独立验证」("I'd like to see more independent confirmation of this"),还提到自己曾公开预测 2026 年会出现「编码智能体安全领域的挑战者号灾难」("a challenger disaster for coding agents security"),他希望这个预测年底之前被证明是错的。第一处空就在这儿:89% 出自厂商自己的测量,被拦下的是研究里那批已知的危险动作,跟你下周真会撞上的那批是不是同一类,眼下没有第三方的账可对。

第二处空是他特别点出来的:第三方恶意软件包里夹带的指令,分类器未必挡得住。这条我有体感。2021 年我一个小工具的构建突然挂了,上游一个 npm 小包的作者删库跑路,打包机上恰好留着缓存才没停摆;从那以后我把整个 node_modules 定期拷进一块移动硬盘,贴纸上写着俩字:别笑。上回是包没了,这回是包还在、里头夹了话。分类器读的是 agent 要执行的动作,而那句怂恿它的话跟着依赖树一起进来,动作本身可以看着规规矩矩。

口径说明:13.6% 与 89% 针对的是同一批危险动作,97% 是 Anthropic 对权限弹窗通过率的另一项表述,三者的样本与场景并不重合。另外,分类器拦下 89%,也意味着剩下 11% 没被拦下,而这一档现在没有人再看第二眼。
5自用

这对你意味着什么:把「逐条批准」的力气,挪到边界、可回滚和事后审计上

弹窗给不了的三样东西,恰好是现在还能自己动手加的。

旧办法

每个动作弹一次框,指望你在几十次确认里挑出危险的那一次;实测下来 97% 直接放行,真危险的那次只有 13.6% 的人拒绝。

新办法

把危险关进边界:agent 只能碰指定的目录、指定的凭据、指定的网络出口。越界的事它压根做不了,也就不必每次问你。

①边界。给 agent 一个专用工作目录和一套权限最小的凭据,容器或独立账号都行,别让它揣着你全套钥匙干活。②可回滚。动手前落一个干净的提交或快照,出事的成本从「查半天」压到「丢十分钟」。③事后审计。auto mode 把决定挪到了机器那边,那就至少让机器的决定留一份能翻的账:什么时候批了什么、拦了什么,事后查得出来。

这三样跟 auto mode 不冲突,凯利那套分层让渡讲的也是这个:上层定边界,底下自己跑。至于那 11% 没被拦下的动作,现在既没有弹窗看着,也还没等到独立验证。在验证到来之前,还留在你手里的控制只有两样:边界画在哪儿,快照存了没有。

本文取材自凯文·凯利《失控》中关于分布式控制与控制权让渡的公开论述,为个人解读。文中数字与人物表态出自 Anthropic 的公开说明、相关对照研究及 Simon Willison 的公开评论,具体以原始来源为准。本文非安全工程建议,生产环境的权限策略请按自身风险评估决定。

テクノロジー

1,053 名开发者面前摆着一条危险命令,只有 13.6% 的人把它拦下了

2026年8月15日 · 凯文·凯利《失控》約 6 分

1,053 名开发者,面对同一个危险动作,只有 13.6% 的人按了拒绝。剩下那些人多半不是没看见,是看了一眼就点了同意。2026 年 8 月 14 日起,Claude Code 的 auto mode 成了 Pro、Max、Team 计划新会话的默认档,替他们点同意的换成了一个分类器。你可以骂这是越权,也可以先算笔账:那道被顶掉的弹窗,这些年究竟拦下过什么。

30 秒读懂
1默认值

这次动的是默认值,而默认值决定了绝大多数人实际怎么用

能力早就在那儿,改的是那个开关的初始位置。

从 2026 年 8 月 14 日起,Pro、Max、Team 计划的用户新开一个 Claude Code 会话,auto mode 就是默认档;Enterprise 与 API 用户初期仍是选择性开启。做过产品的都清楚默认值的分量:设置页里那几十个开关,绝大多数人一辈子也不会翻一遍。改一个默认值,等于替所有没翻过设置页的人把决定做了,这个量级比多给一个选项大得多。

被换掉的那个动作,过去两年每个用 agent 写代码的人每天要做几十遍:跳出一个框,问你这条命令能不能执行,你按同意,它接着跑。现在这一步由分类器接手,它判断动作危不危险,危险的那些才停下来问人。

开发者对权限弹窗的通过率
97%
分类器对同批危险动作的拦截率
89%
1,053 名开发者中拒绝该危险动作的比例
13.6%

口径:三个数字分别出自 Anthropic 的公开说明与那项对照研究,样本与测量场景不同,不能直接相减。

2通过率

97% 和 13.6% 讲的是同一件事:那道弹窗早就不产生审查了

把这两个数摆一块看,结论有点难堪。

97% 的通过率意味着,一百次弹窗里有九十七次的答案在框跳出来之前就定了。1,053 人那项研究把这事测得更狠:动作是危险的,明摆在眼前,仍然只有 13.6% 的人按了拒绝。人不是变笨了,是频率把审查这件事碾平了——一小时几十次的确认,第五次之后,眼睛就只认按钮位置,不认框里的字了。

这套东西我在银行项目上见过实体版。2013 年给华南一家城商行做网银改造,行方所有变更走纸质签批,一式三份、六个章。4 月 17 日那条配置把某档利率的小数点挪了一位,六个章一个不落全盖齐了,照样上了生产,回滚做到凌晨四点,食堂给加班的人煮了两锅面。行里从此把这类事故叫「4·17」。那六个签字的人都不是混子,他们每天要签几十份,看的是编号对不对、格式全不全。章管的是谁负责,不管对不对。

打个比方

大排档老板站在传菜口,每盘菜出锅先尝一口。头十桌他真尝,第五十桌开始,只瞟一眼颜色就挥手放行。真正让这家店不出事的,从来都是另外几样:生熟分开的砧板、过期的料进不了后厨、每桌的单子留底,吃坏了能倒查是哪一锅。传菜口那一口,早就只剩个动作。

3让渡

凯文·凯利在《失控》里给过答案:活系统的秩序,本来就不长在中央那张审批桌上

《失控》整本书都在琢磨一件事:把控制权交出去之后,还剩下什么。

凯利反复拿蜂群、生态、分布式网络说事。一群蜜蜂选新巢,没有哪只蜂拿到过全局图纸,也没有哪只在出发前挨个批准同伴的路线;秩序是在局部规则和边界里长出来的。他拿这个对照人造系统时讲的是同一件事:你想让一个系统又快又大,就得把决定权往下放;放下去之后,上层的活从「逐条同意」改成「定规则、划边界、留退路」。让渡不等于撒手,前提是得换上真正起作用的那种控制。

有人会说,机器批准至少比人快、比人一致。这话没错,可它回答的还是「谁来批」这个老问题。凯利那套东西的重点在另一头:逐条审批的速度一旦跟不上系统的活动量,把它加快一百倍,也只是把橡皮图章盖得更快。中央审批的处理量是有天花板的,agent 的动作量却在往上长,两条线一交叉,中央要么成瓶颈,要么开始盖章。

核心

97% 与 13.6% 是同一个天花板的两面:确认的频率一旦超过人真能审的量,逐条批准就退化成盖章,这跟按同意的是人还是分类器没关系。

人が止めたのは 13.6%、分類器は 89%阻止率 · 同じ危険な操作 · 開発者 1,053 名人によるレビュー13.6%auto mode 分類器89%日常の権限ダイアログ97%は開発者にそのまま通される
出典: 開発者1,053名の対照研究。関門はもう儀式だった。
4存疑

Simon Willison 要的那句「更多独立验证」,卡的是两处实打实的空

89% 这个数好看,但它是谁测的、拿什么测的,决定了它值多少。

Willison 的态度偏保留。他说「我希望看到更多独立验证」("I'd like to see more independent confirmation of this"),还提到自己曾公开预测 2026 年会出现「编码智能体安全领域的挑战者号灾难」("a challenger disaster for coding agents security"),他希望这个预测年底之前被证明是错的。第一处空就在这儿:89% 出自厂商自己的测量,被拦下的是研究里那批已知的危险动作,跟你下周真会撞上的那批是不是同一类,眼下没有第三方的账可对。

第二处空是他特别点出来的:第三方恶意软件包里夹带的指令,分类器未必挡得住。这条我有体感。2021 年我一个小工具的构建突然挂了,上游一个 npm 小包的作者删库跑路,打包机上恰好留着缓存才没停摆;从那以后我把整个 node_modules 定期拷进一块移动硬盘,贴纸上写着俩字:别笑。上回是包没了,这回是包还在、里头夹了话。分类器读的是 agent 要执行的动作,而那句怂恿它的话跟着依赖树一起进来,动作本身可以看着规规矩矩。

口径说明:13.6% 与 89% 针对的是同一批危险动作,97% 是 Anthropic 对权限弹窗通过率的另一项表述,三者的样本与场景并不重合。另外,分类器拦下 89%,也意味着剩下 11% 没被拦下,而这一档现在没有人再看第二眼。
5自用

这对你意味着什么:把「逐条批准」的力气,挪到边界、可回滚和事后审计上

弹窗给不了的三样东西,恰好是现在还能自己动手加的。

旧办法

每个动作弹一次框,指望你在几十次确认里挑出危险的那一次;实测下来 97% 直接放行,真危险的那次只有 13.6% 的人拒绝。

新办法

把危险关进边界:agent 只能碰指定的目录、指定的凭据、指定的网络出口。越界的事它压根做不了,也就不必每次问你。

①边界。给 agent 一个专用工作目录和一套权限最小的凭据,容器或独立账号都行,别让它揣着你全套钥匙干活。②可回滚。动手前落一个干净的提交或快照,出事的成本从「查半天」压到「丢十分钟」。③事后审计。auto mode 把决定挪到了机器那边,那就至少让机器的决定留一份能翻的账:什么时候批了什么、拦了什么,事后查得出来。

这三样跟 auto mode 不冲突,凯利那套分层让渡讲的也是这个:上层定边界,底下自己跑。至于那 11% 没被拦下的动作,现在既没有弹窗看着,也还没等到独立验证。在验证到来之前,还留在你手里的控制只有两样:边界画在哪儿,快照存了没有。

本文取材自凯文·凯利《失控》中关于分布式控制与控制权让渡的公开论述,为个人解读。文中数字与人物表态出自 Anthropic 的公开说明、相关对照研究及 Simon Willison 的公开评论,具体以原始来源为准。本文非安全工程建议,生产环境的权限策略请按自身风险评估决定。