vlog
← 返回全部文章

Tech

真人流量只剩 2%:Linux 内核官网正被 AI 爬虫啃成牧场

2026年8月31日 · 凯文·凯利《失控》~2 min read

git.kernel.org 在全球摆了 5 个节点,一共 90 颗 CPU 核。其中 14 到 16 颗,全年无休只干一件事:把 git commit 渲染成 HTML 网页,喂给 AI 爬虫。这一件事吃掉的算力,比全站所有合法访问加起来还多,git clone 都算上。至于合法访问本身,宽松口径下,真人大约只占全部请求的 2%。

30 秒读懂
1报数

全站两成算力,常年伺候一群不看内容的客人

这些数字不是猜的,是管理员从自家机房里一颗核一颗核数出来的。

2026 年 8 月 29 日,kernel.org 的基础设施管理员 Konstantin Ryabitsev 发了篇博文,标题叫《Creepy crawlies》,直译过来是「爬来爬去的玩意儿」。文章在 Hacker News 上拿了 873 分、397 条评论,因为这是头一回有人把「AI 爬虫吃垮公共基础设施」从抱怨落成账本:每天约 600 万次请求,索要的全是随机 commit 页面;90 颗核里有 14 到 16 颗常驻渲染,约占总容量两成;把 git clone 都算进去,全站合法访问加起来也没这一项烧得多。

给爬虫渲染页面占用的 CPU 容量
20%
被 Anubis 挑战拦下的请求
66%
付出算力硬闯进来的请求
33%
真人合法请求占全部请求
2%

四个数出自同一篇博文,但分母不同:第一条是 CPU 容量占比,后三条是请求量占比,其中 2% 为作者自称的宽松估算。

2吃相

正门免费敞开三十年,爬虫偏要挨个翻几十亿扇窗

让运维血压升高的与其说是量,倒不如说是吃法。

linux.git 约有 148 万个 commit,站上另有 922 个 fork。后端对象是共享的,fork 再多也几乎不占地方,架构上本来极高效。kernel.org 又一直免费开放 git clone,连 LKML 邮件列表的全部档案也任人下载。

正门:git clone

一条命令,整个仓库几十年的历史打包带走,后端按对象增量传输,服务器出一次力就够。

爬虫的走法

逐页索要渲染好的 HTML。commit、patch、diff 任意组合,一个 fork 就能生成几十亿个合法 URL;爬完 922 个 fork,拿到的是 922 份重复内容。

你可能想说:写爬虫的人不懂 git?多半懂。凯文·凯利在《失控》里观察生态系统时点破过一层:寄生者的成本函数里,从来没有宿主的死活这一项。对爬虫背后的公司来说,逐页渲染的电费和 CPU 记在 kernel.org 的账上,改成 git clone 省下的钱也不进自己口袋,蠢办法就没有改的动力。

THE FRONT DOOR IS OPEN — 20% OF CPU GOES TO WINDOW-CLIMBERSGIT.KERNEL.ORG · ONE DAY6M requests / dayrandom commit pagesAnubis PoW gate66% turned away33% pay compute, brute indifficulty 4 & 5: cracked14–16 of 90 cores≈20% capacity, always onrendering HTML for botsSAME DATA, TWO WAYS INFront door: git cloneall 1.48M commits in one commandshared objects · free for 30 yearsThe window: page scraping922 forks × billions of URLs922 copies of the same historyfuels the flood above2%of all requests are humanrequest flowcrawlers' choice
Source: kernel.org admin Konstantin Ryabitsev, “Creepy crawlies” (2026-08-29). At the gate Anubis turns away 66% of requests and 33% brute through with compute; humans are ≈2% of traffic, yet ≈20% of CPU sits rendering pages for bots — while git clone hands over everything for free. Figures follow the blog post.
3矿脉

它们抢的是「前 AI 地层」:保证没被机器碰过的语料

为什么偏偏是 kernel.org?因为这里的旧货有个别处买不到的卖点。

内核开发全程公开,几十年的 commit 记录和邮件讨论都摊在光天化日之下。更值钱的是时间戳:历史 commit 写在 AI 出现之前,保证是纯净的人类产物。Ryabitsev 点出了买家的心思:用 LLM 的产出去训练 LLM,会得「数字朊病毒病」;无污染语料如今贵如黄金。

打个比方

疯牛病的来历,课本里写得明白:把牛骨牛内脏磨成粉,再拌进饲料喂给牛。同类喂同类,错误折叠的蛋白质一代代浓缩,直到牛群站不起来。模型吃模型的产出,走的是同一条路。于是没被机器碰过的老语料成了硬通货,而 kernel.org 的 commit 历史,正是一座敞着口的露天富矿。

4追逐

封 UA、封 IP、封 ASN,四道防线四次落空

攻防的展开顺序,像照着演习脚本走的。

宿主的防线寄生者的应手
按 User-Agent 封伪装成普通浏览器
按 IP 封换 IP 池接着爬
按整个 ASN(自治网络)封整体搬去别的网络
能封的都封了改用数百万住宅与移动 IP,每个 IP 发 4–5 个请求就消失,封无可封

数百万住宅 IP 从哪来?背后是一条「代理 SDK 变现」产业链:SDK 塞进各种 app 和联网设备,把普通家庭的网络出口转卖出去。据 spur.us 的报道,你家的智能电视,可能正在替爬虫出口流量。《失控》里写寄生者与宿主的共同演化,用的是红皇后的典故:两边都在拼命跑,谁也甩不掉谁,跑得再快也只是留在原地。kernel.org 每筑一道墙,客观上都在替爬虫做一轮筛选,留下来的全是翻墙翻得最好的。

5门票

让访客先算道数学题,这道防线也开始漏了

谈判不成,只好收门票,票价用算力支付。

最后一道防线叫 Anubis,思路是工作量证明:进门前先算出一个 sha256 哈希,要求前导 4 个零。起初立竿见影,爬虫掉头就走;几个月后,难度 4 被解了;升到难度 5,真人拿手机也要算上几秒钟,机身发烫;如今难度 5 也被解了。今天,66% 的请求仍被挑战拦在门外,剩下 33% 掏出算力硬闯进来。

为什么不坐下来谈?因为对面没有可以坐下来的人。《失控》里那种去中心化的群体,蝗群也好、蜂群也好,压根不存在一个能签停战协议的对手方。每一只爬虫背后的公司都可以说自己流量不大,就像公共草场上每头牛的主人都觉得多啃一口不碍事。公地的悲剧,这回在机器生态里原样重演。

核心

单个爬虫没有恶意,把公共基础设施变成牧场的,是群体行为本身。这是生态学事件,不是安全事件。

「难度 4 / 难度 5」指要求哈希值开头的零的个数;每加一位,平均要试的哈希次数就翻着倍往上涨。66% 与 33% 为博文发表当日的比例。
6带走

这对你意味着什么:公网上任何无限 URL 空间,都是招灾体质

kernel.org 的今天,是每个公开站点的预告片。

结局已经开始了:kernel.org 着手关闭功能、减少可爬的 URL,匿名访问将失去部分能力;同时承诺数据照旧向所有人开放下载,用 Ryabitsev 的话说,「只是要多跳几道圈」。如果你也在公网上维护着点什么,有三条作业可以直接抄。清点你的 URL 空间:凡是参数一组合就能无限生成页面的功能,日历翻页、任意两版 diff、无尽分页,都是被动招灾体质,能收敛就收敛。给机器修正门:打包下载、数据 dump、API 都行,但别指望正门能感化谁,kernel.org 的正门敞开了三十年,爬虫照样翻窗。第三条最要紧:防线按成本设计,别按善意设计。robots.txt 和封禁名单都预设对面有一个能收到信号的「人」,而蝗群里没有收件人。

⚡

为什么这不只是运维圈的事:你每天用的开源基础设施,大多就靠这样几十颗核的小机房撑着。牧场被啃秃之后,先没草吃的是所有人。

博文结尾,Ryabitsev 给这场对峙留了两个出口,意译过来是:要么 AI 泡沫破裂,爬虫自然退潮;要么它们哪天聪明起来,不再用最蠢的方式消费我们的数据。军备竞赛的收场向来也就两种,一方先跑不动,或者两边学会共生。你押哪一种?

取材声明:本文思想框架取材自凯文·凯利《失控》(寄生者与宿主的共同演化、公地的悲剧、去中心化群体);事实与全部数字来自 kernel.org 管理员 Konstantin Ryabitsev 2026 年 8 月 29 日的公开博文《Creepy crawlies》及其中数据,细节以原文为准。本文为技术科普解读。

技术

真人流量只剩 2%:Linux 内核官网正被 AI 爬虫啃成牧场

2026年8月31日 · 凯文·凯利《失控》约 6 分钟

git.kernel.org 在全球摆了 5 个节点,一共 90 颗 CPU 核。里头有 14 到 16 颗,全年无休只干一件事:把 git commit 渲染成 HTML 网页,喂给 AI 爬虫。就这一件事烧掉的算力,比全站所有合法访问加起来还多,git clone 都算上。真人呢?按宽松口径算,大约只占全部请求的 2%。

30 秒读懂
1报数

全站两成算力,常年伺候一群不看内容的客人

这些数字没什么玄乎的,管理员是从自家机房里一颗核一颗核数出来的。

2026 年 8 月 29 日,kernel.org 的基础设施管理员 Konstantin Ryabitsev 发了篇博文,标题《Creepy crawlies》,直译就是「爬来爬去的玩意儿」,在 Hacker News 上拿了 873 分、397 条评论。骂 AI 爬虫的帖子这两年天天有,把账一笔笔摊开的,这是头一回:每天约 600 万次请求,专挑随机 commit 页面要;90 颗核里 14 到 16 颗常驻给它们渲染,约占总容量两成;把 git clone 都算进去,全站合法访问加一块儿,也没这一项烧得多。

给爬虫渲染页面占用的 CPU 容量
20%
被 Anubis 挑战拦下的请求
66%
付出算力硬闯进来的请求
33%
真人合法请求占全部请求
2%

四个数出自同一篇博文,但分母不同:第一条是 CPU 容量占比,后三条是请求量占比,其中 2% 为作者自称的宽松估算。

2吃相

正门免费敞开三十年,爬虫偏要挨个翻几十亿扇窗

让运维血压升高的,与其说是量,不如说是吃相。

linux.git 约有 148 万个 commit,站上另挂着 922 个 fork。你别看 922 个 fork 听着吓人,后端对象是共享的,fork 再多也几乎不占地方,这套架构本来省得很。kernel.org 一直免费开放 git clone,连 LKML 邮件列表的全部档案也任人下载。

正门:git clone

一条命令,整个仓库几十年的历史打包带走,后端按对象增量传输,服务器出一次力就够。

爬虫的走法

逐页索要渲染好的 HTML。commit、patch、diff 任意组合,一个 fork 就能生成几十亿个合法 URL;爬完 922 个 fork,拿到的是 922 份重复内容。

你可能想说,写爬虫的人不懂 git?多半懂。凯文·凯利在《失控》里看生态系统的时候点破过一层:寄生者的成本函数里,从来没有宿主的死活这一项。搁到爬虫背后的公司头上,就是笔明账:逐页渲染的电费和 CPU 记在 kernel.org 名下,改成 git clone,省下的钱也不进自己口袋。费用记在别人账上,蠢办法就没有改的动力。

正门开着没人走,两成算力耗在翻窗户上git.kernel.org 的一天每日 600 万次请求索要随机 commit 页面Anubis 工作量证明闸门66% 被拦在门外33% 付出算力硬闯难度 4 与 5 均被破解90 颗核里的 14–16 颗约两成容量,常年占用只为给爬虫渲染 HTML同一份数据 · 两种拿法正门:git clone 一条命令148 万 commit 全历史一次拿走对象共享 · 免费开放三十年翻窗:逐页抓渲染页面922 个 fork × 几十亿 URL拿到 922 份重复内容上面洪水的源头2%全部请求里的真人占比请求流爬虫的选择
来源:kernel.org 管理员 Konstantin Ryabitsev 博文《Creepy crawlies》(2026-08-29)。闸门处 Anubis 拦下 66% 的请求、33% 付出算力硬闯;真人仅约 2%,却有约 20% 的 CPU 常年只为爬虫渲染页面——正门 git clone 明明免费敞开。数字为其博文口径。
3矿脉

它们抢的是「前 AI 地层」:保证没被机器碰过的语料

为什么偏偏薅 kernel.org?因为这儿的旧货,有别处买不到的卖点。

内核开发全程公开,几十年的 commit 记录和邮件讨论都摊在光天化日之下。真正值钱的是时间戳:历史 commit 写在 AI 出现之前,保证是纯净的人类产物。Ryabitsev 把买家的心思点破了:拿 LLM 的产出去训练 LLM,会得「数字朊病毒病」;没被污染的语料,如今贵如黄金。

打个比方

疯牛病怎么来的,课本里写得明白:牛骨牛下水磨成粉,拌进饲料再喂给牛。同类喂同类,折叠错了的蛋白质一代代往浓里攒,攒到牛群站不起来。模型吃模型的产出,走的就是这条道。所以没被机器碰过的老语料成了硬通货,而 kernel.org 的 commit 历史,正是一座敞着口的露天富矿。

4追逐

封 UA、封 IP、封 ASN,四道防线四次落空

攻防展开的顺序,跟照着演习脚本走似的。

宿主的防线寄生者的应手
按 User-Agent 封伪装成普通浏览器
按 IP 封换 IP 池接着爬
按整个 ASN(自治网络)封整体搬去别的网络
能封的都封了改用数百万住宅与移动 IP,每个 IP 发 4–5 个请求就消失,封无可封

那数百万住宅 IP 打哪来?背后是一条「代理 SDK 变现」的产业链:SDK 塞进各种 app 和联网设备,把普通人家的网络出口转手卖掉。据 spur.us 的报道,你家那台智能电视,可能正替爬虫出口流量。《失控》写寄生者与宿主的共同演化,用的是红皇后的典故:两边都在玩命跑,谁也甩不掉谁,跑再快也只是留在原地。更别扭的是,kernel.org 每筑一道墙,客观上都在替对面做一轮筛选,能留下来的,全是翻墙翻得最利索的。

5门票

让访客先算道数学题,这道防线也开始漏了

谈不拢,只好收门票,票价用算力付。

最后一道防线叫 Anubis,思路是工作量证明:进门先算出一个 sha256 哈希,要求前导 4 个零。起初立竿见影,爬虫掉头就走;几个月后,难度 4 被解了。升到难度 5,真人拿手机进站也得算上几秒钟,机身发烫;如今难度 5 也被解了。到今天,66% 的请求仍被挑战拦在门外,还有 33% 掏出算力硬闯进来。

那为啥不坐下来谈?因为对面压根没有能坐下来的人。《失控》里那种去中心化的群体,蝗群也好、蜂群也好,从来不存在一个能替全体签停战协议的对手方。每家爬虫公司都可以说自己那点流量不算啥,就像公共草场上每头牛的主人都觉得多啃一口不碍事。公地的悲剧,这回在机器生态里原样重演了一遍。

核心

单个爬虫没有恶意,把公共基础设施变成牧场的,是群体行为本身。这是生态学事件,不是安全事件。

「难度 4 / 难度 5」指要求哈希值开头的零的个数;每加一位,平均要试的哈希次数就翻着倍往上涨。66% 与 33% 为博文发表当日的比例。
6带走

这对你意味着什么:公网上任何无限 URL 空间,都是招灾体质

kernel.org 的今天,就是每个公开站点的预告片。

结局已经开演:kernel.org 着手关功能、减少可爬的 URL,匿名访问要失去一部分能力;数据照旧向所有人开放下载,用 Ryabitsev 的话说,「只是得多绕几道弯」。你要是也在公网上养着点什么,有三条作业可以直接抄。头一条,清点自己的 URL 空间:凡是参数一组合就能无限生成页面的功能,日历翻页、任意两版 diff、无尽分页,全是招灾体质,能收敛就收敛。第二条,给机器修个正门:打包下载、数据 dump、API 都行,但别指望正门能感化谁,kernel.org 的正门敞开了三十年,爬虫照样翻窗。第三条最实在:防线按成本设计,别按善意设计。说白了,robots.txt 和封禁名单都预设对面有个能收到信号的「人」,蝗群里没有收件人。

头一条我有收据。2025 年秋,我那 SaaS 的模板挑选页起过怪流量:一百二十七张模板图,行业、配色、尺寸三个参数一组合,每种组合就是一个独立 URL,爬虫挨个组合翻,高峰一晚上翻掉二十多万页,轻量服务器的流量包月中就见了底。页脚那个全部模板打包的 zip 挂了两年,后台下载计数是 7。封 UA,第二天对面换个浏览器标识;封 IP 段,请求散成几百个零散 IP,一个来几十下就走。最后我把组合筛选页整个撤了,只留一张静态目录页加那个 zip,账单当月落回去。一百二十七张图对一百四十八万个 commit,庙有大小,香客是同一拨。

⚡

为什么这不只是运维圈的事:你每天用的开源基础设施,大多就靠这么几十颗核的小机房撑着。牧场啃秃了,先没草吃的是所有人。

博文末尾,Ryabitsev 给这场对峙留了两个出口,意译过来是:要么 AI 泡沫破了,爬虫自然退潮;要么它们哪天开窍,不再用最蠢的方式抓我们的数据。军备竞赛的收场从来也就两种,一方先跑不动,或者两边学会共生。你押哪一种?

取材声明:本文思想框架取材自凯文·凯利《失控》(寄生者与宿主的共同演化、公地的悲剧、去中心化群体);事实与全部数字来自 kernel.org 管理员 Konstantin Ryabitsev 2026 年 8 月 29 日的公开博文《Creepy crawlies》及其中数据,细节以原文为准。本文为技术科普解读。

テクノロジー

真人流量只剩 2%:Linux 内核官网正被 AI 爬虫啃成牧场

2026年8月31日 · 凯文·凯利《失控》約 6 分

git.kernel.org 在全球摆了 5 个节点,一共 90 颗 CPU 核。其中 14 到 16 颗,全年无休只干一件事:把 git commit 渲染成 HTML 网页,喂给 AI 爬虫。这一件事吃掉的算力,比全站所有合法访问加起来还多,git clone 都算上。至于合法访问本身,宽松口径下,真人大约只占全部请求的 2%。

30 秒读懂
1报数

全站两成算力,常年伺候一群不看内容的客人

这些数字不是猜的,是管理员从自家机房里一颗核一颗核数出来的。

2026 年 8 月 29 日,kernel.org 的基础设施管理员 Konstantin Ryabitsev 发了篇博文,标题叫《Creepy crawlies》,直译过来是「爬来爬去的玩意儿」。文章在 Hacker News 上拿了 873 分、397 条评论,因为这是头一回有人把「AI 爬虫吃垮公共基础设施」从抱怨落成账本:每天约 600 万次请求,索要的全是随机 commit 页面;90 颗核里有 14 到 16 颗常驻渲染,约占总容量两成;把 git clone 都算进去,全站合法访问加起来也没这一项烧得多。

给爬虫渲染页面占用的 CPU 容量
20%
被 Anubis 挑战拦下的请求
66%
付出算力硬闯进来的请求
33%
真人合法请求占全部请求
2%

四个数出自同一篇博文,但分母不同:第一条是 CPU 容量占比,后三条是请求量占比,其中 2% 为作者自称的宽松估算。

2吃相

正门免费敞开三十年,爬虫偏要挨个翻几十亿扇窗

让运维血压升高的与其说是量,倒不如说是吃法。

linux.git 约有 148 万个 commit,站上另有 922 个 fork。后端对象是共享的,fork 再多也几乎不占地方,架构上本来极高效。kernel.org 又一直免费开放 git clone,连 LKML 邮件列表的全部档案也任人下载。

正门:git clone

一条命令,整个仓库几十年的历史打包带走,后端按对象增量传输,服务器出一次力就够。

爬虫的走法

逐页索要渲染好的 HTML。commit、patch、diff 任意组合,一个 fork 就能生成几十亿个合法 URL;爬完 922 个 fork,拿到的是 922 份重复内容。

你可能想说:写爬虫的人不懂 git?多半懂。凯文·凯利在《失控》里观察生态系统时点破过一层:寄生者的成本函数里,从来没有宿主的死活这一项。对爬虫背后的公司来说,逐页渲染的电费和 CPU 记在 kernel.org 的账上,改成 git clone 省下的钱也不进自己口袋,蠢办法就没有改的动力。

正面玄関は開いているのに、CPUの2割は窓越えに費やされるgit.kernel.org のある一日毎日600万リクエストランダムなcommitページAnubis PoW の関門66% は門前払い33% は計算力で突破難易度4も5も突破済み90コア中14–16コア容量の約2割が常駐ボット向けHTML描画のみ同じデータ · 二つの入り方正面玄関:git clone 一発148万commitの全履歴を一括でオブジェクト共有・30年間無料窓越え:ページを逐一収集922フォーク×数十億URL得るのは922部の重複内容上の洪水の源2%全リクエスト中の人間の割合リクエスト流ボットの選択
出典:kernel.org 管理者 Konstantin Ryabitsev のブログ「Creepy crawlies」(2026-08-29)。関門の Anubis はリクエストの 66% を追い返し、33% は計算力で突破。人間は約 2% にすぎないのに、CPU の約 20% はボット向けのページ描画に常駐——git clone という正面玄関は無料で開いているのに。数値は同ブログの記載による。
3矿脉

它们抢的是「前 AI 地层」:保证没被机器碰过的语料

为什么偏偏是 kernel.org?因为这里的旧货有个别处买不到的卖点。

内核开发全程公开,几十年的 commit 记录和邮件讨论都摊在光天化日之下。更值钱的是时间戳:历史 commit 写在 AI 出现之前,保证是纯净的人类产物。Ryabitsev 点出了买家的心思:用 LLM 的产出去训练 LLM,会得「数字朊病毒病」;无污染语料如今贵如黄金。

打个比方

疯牛病的来历,课本里写得明白:把牛骨牛内脏磨成粉,再拌进饲料喂给牛。同类喂同类,错误折叠的蛋白质一代代浓缩,直到牛群站不起来。模型吃模型的产出,走的是同一条路。于是没被机器碰过的老语料成了硬通货,而 kernel.org 的 commit 历史,正是一座敞着口的露天富矿。

4追逐

封 UA、封 IP、封 ASN,四道防线四次落空

攻防的展开顺序,像照着演习脚本走的。

宿主的防线寄生者的应手
按 User-Agent 封伪装成普通浏览器
按 IP 封换 IP 池接着爬
按整个 ASN(自治网络)封整体搬去别的网络
能封的都封了改用数百万住宅与移动 IP,每个 IP 发 4–5 个请求就消失,封无可封

数百万住宅 IP 从哪来?背后是一条「代理 SDK 变现」产业链:SDK 塞进各种 app 和联网设备,把普通家庭的网络出口转卖出去。据 spur.us 的报道,你家的智能电视,可能正在替爬虫出口流量。《失控》里写寄生者与宿主的共同演化,用的是红皇后的典故:两边都在拼命跑,谁也甩不掉谁,跑得再快也只是留在原地。kernel.org 每筑一道墙,客观上都在替爬虫做一轮筛选,留下来的全是翻墙翻得最好的。

5门票

让访客先算道数学题,这道防线也开始漏了

谈判不成,只好收门票,票价用算力支付。

最后一道防线叫 Anubis,思路是工作量证明:进门前先算出一个 sha256 哈希,要求前导 4 个零。起初立竿见影,爬虫掉头就走;几个月后,难度 4 被解了;升到难度 5,真人拿手机也要算上几秒钟,机身发烫;如今难度 5 也被解了。今天,66% 的请求仍被挑战拦在门外,剩下 33% 掏出算力硬闯进来。

为什么不坐下来谈?因为对面没有可以坐下来的人。《失控》里那种去中心化的群体,蝗群也好、蜂群也好,压根不存在一个能签停战协议的对手方。每一只爬虫背后的公司都可以说自己流量不大,就像公共草场上每头牛的主人都觉得多啃一口不碍事。公地的悲剧,这回在机器生态里原样重演。

核心

单个爬虫没有恶意,把公共基础设施变成牧场的,是群体行为本身。这是生态学事件,不是安全事件。

「难度 4 / 难度 5」指要求哈希值开头的零的个数;每加一位,平均要试的哈希次数就翻着倍往上涨。66% 与 33% 为博文发表当日的比例。
6带走

这对你意味着什么:公网上任何无限 URL 空间,都是招灾体质

kernel.org 的今天,是每个公开站点的预告片。

结局已经开始了:kernel.org 着手关闭功能、减少可爬的 URL,匿名访问将失去部分能力;同时承诺数据照旧向所有人开放下载,用 Ryabitsev 的话说,「只是要多跳几道圈」。如果你也在公网上维护着点什么,有三条作业可以直接抄。清点你的 URL 空间:凡是参数一组合就能无限生成页面的功能,日历翻页、任意两版 diff、无尽分页,都是被动招灾体质,能收敛就收敛。给机器修正门:打包下载、数据 dump、API 都行,但别指望正门能感化谁,kernel.org 的正门敞开了三十年,爬虫照样翻窗。第三条最要紧:防线按成本设计,别按善意设计。robots.txt 和封禁名单都预设对面有一个能收到信号的「人」,而蝗群里没有收件人。

⚡

为什么这不只是运维圈的事:你每天用的开源基础设施,大多就靠这样几十颗核的小机房撑着。牧场被啃秃之后,先没草吃的是所有人。

博文结尾,Ryabitsev 给这场对峙留了两个出口,意译过来是:要么 AI 泡沫破裂,爬虫自然退潮;要么它们哪天聪明起来,不再用最蠢的方式消费我们的数据。军备竞赛的收场向来也就两种,一方先跑不动,或者两边学会共生。你押哪一种?

取材声明:本文思想框架取材自凯文·凯利《失控》(寄生者与宿主的共同演化、公地的悲剧、去中心化群体);事实与全部数字来自 kernel.org 管理员 Konstantin Ryabitsev 2026 年 8 月 29 日的公开博文《Creepy crawlies》及其中数据,细节以原文为准。本文为技术科普解读。