Tech
真人流量只剩 2%:Linux 内核官网正被 AI 爬虫啃成牧场
2026年8月31日 · 凯文·凯利《失控》~2 min read
Author’s take
蝗群里没有收件人;防线按成本设计,别按善意设计。
Marcus Webb The Builder
git.kernel.org 在全球摆了 5 个节点,一共 90 颗 CPU 核。其中 14 到 16 颗,全年无休只干一件事:把 git commit 渲染成 HTML 网页,喂给 AI 爬虫。这一件事吃掉的算力,比全站所有合法访问加起来还多,git clone 都算上。至于合法访问本身,宽松口径下,真人大约只占全部请求的 2%。
30 秒读懂
2026 年 8 月 29 日,kernel.org 基础设施管理员 Konstantin Ryabitsev 发博文《Creepy crawlies》,头一回给出 AI 爬虫冲击 git.kernel.org 的硬数字,Hacker News 873 分、397 条评论。
90 颗核里 14–16 颗(约两成容量)常驻给爬虫渲染 commit 页面,开销超过全部合法访问的总和;每天约 600 万次请求索要随机 commit 页。
linux.git 约 148 万个 commit、922 个 fork,一个 fork 就能生成几十亿个合法 URL;而 git clone 一条命令就能免费拿走全部历史,爬虫偏不用。
封 User-Agent、封 IP、封 ASN 逐级失效:爬虫改用数百万住宅与移动 IP,每个 IP 只发 4–5 个请求就消失。
工作量证明 Anubis 今天仍拦下 66% 的请求,另有 33% 付出算力硬闯;kernel.org 已开始关闭功能、减少可爬 URL,但承诺数据照旧向所有人开放下载。
1 报数
全站两成算力,常年伺候一群不看内容的客人
这些数字不是猜的,是管理员从自家机房里一颗核一颗核数出来的。
2026 年 8 月 29 日,kernel.org 的基础设施管理员 Konstantin Ryabitsev 发了篇博文,标题叫《Creepy crawlies》,直译过来是「爬来爬去的玩意儿」。文章在 Hacker News 上拿了 873 分、397 条评论,因为这是头一回有人把「AI 爬虫吃垮公共基础设施」从抱怨落成账本:每天约 600 万次请求,索要的全是随机 commit 页面;90 颗核里有 14 到 16 颗常驻渲染,约占总容量两成;把 git clone 都算进去,全站合法访问加起来也没这一项烧得多。
四个数出自同一篇博文,但分母不同:第一条是 CPU 容量占比,后三条是请求量占比,其中 2% 为作者自称的宽松估算。
2 吃相
正门免费敞开三十年,爬虫偏要挨个翻几十亿扇窗
让运维血压升高的与其说是量,倒不如说是吃法。
linux.git 约有 148 万个 commit,站上另有 922 个 fork。后端对象是共享的,fork 再多也几乎不占地方,架构上本来极高效。kernel.org 又一直免费开放 git clone,连 LKML 邮件列表的全部档案也任人下载。
正门:git clone
一条命令,整个仓库几十年的历史打包带走,后端按对象增量传输,服务器出一次力就够。
爬虫的走法
逐页索要渲染好的 HTML。commit、patch、diff 任意组合,一个 fork 就能生成几十亿个合法 URL;爬完 922 个 fork,拿到的是 922 份重复内容。
你可能想说:写爬虫的人不懂 git?多半懂。凯文·凯利在《失控》里观察生态系统时点破过一层:寄生者的成本函数里,从来没有宿主的死活这一项。对爬虫背后的公司来说,逐页渲染的电费和 CPU 记在 kernel.org 的账上,改成 git clone 省下的钱也不进自己口袋,蠢办法就没有改的动力。
THE FRONT DOOR IS OPEN — 20% OF CPU GOES TO WINDOW-CLIMBERS GIT.KERNEL.ORG · ONE DAY 6M requests / day random commit pages Anubis PoW gate 66% turned away 33% pay compute, brute in difficulty 4 & 5: cracked 14–16 of 90 cores ≈20% capacity, always on rendering HTML for bots SAME DATA, TWO WAYS IN Front door: git clone all 1.48M commits in one command shared objects · free for 30 years The window: page scraping 922 forks × billions of URLs 922 copies of the same history fuels the flood above 2% of all requests are human request flow crawlers' choice Source: kernel.org admin Konstantin Ryabitsev, “Creepy crawlies” (2026-08-29). At the gate Anubis turns away 66% of requests and 33% brute through with compute; humans are ≈2% of traffic, yet ≈20% of CPU sits rendering pages for bots — while git clone hands over everything for free. Figures follow the blog post.
3 矿脉
它们抢的是「前 AI 地层」:保证没被机器碰过的语料
为什么偏偏是 kernel.org?因为这里的旧货有个别处买不到的卖点。
内核开发全程公开,几十年的 commit 记录和邮件讨论都摊在光天化日之下。更值钱的是时间戳:历史 commit 写在 AI 出现之前,保证是纯净的人类产物。Ryabitsev 点出了买家的心思:用 LLM 的产出去训练 LLM,会得「数字朊病毒病」;无污染语料如今贵如黄金。
打个比方
疯牛病的来历,课本里写得明白:把牛骨牛内脏磨成粉,再拌进饲料喂给牛。同类喂同类,错误折叠的蛋白质一代代浓缩,直到牛群站不起来。模型吃模型的产出,走的是同一条路。于是没被机器碰过的老语料成了硬通货,而 kernel.org 的 commit 历史,正是一座敞着口的露天富矿。
4 追逐
封 UA、封 IP、封 ASN,四道防线四次落空
攻防的展开顺序,像照着演习脚本走的。
宿主的防线 寄生者的应手
按 User-Agent 封 伪装成普通浏览器
按 IP 封 换 IP 池接着爬
按整个 ASN(自治网络)封 整体搬去别的网络
能封的都封了 改用数百万住宅与移动 IP,每个 IP 发 4–5 个请求就消失,封无可封
数百万住宅 IP 从哪来?背后是一条「代理 SDK 变现」产业链:SDK 塞进各种 app 和联网设备,把普通家庭的网络出口转卖出去。据 spur.us 的报道,你家的智能电视,可能正在替爬虫出口流量。《失控》里写寄生者与宿主的共同演化,用的是红皇后的典故:两边都在拼命跑,谁也甩不掉谁,跑得再快也只是留在原地。kernel.org 每筑一道墙,客观上都在替爬虫做一轮筛选,留下来的全是翻墙翻得最好的。
5 门票
让访客先算道数学题,这道防线也开始漏了
谈判不成,只好收门票,票价用算力支付。
最后一道防线叫 Anubis,思路是工作量证明:进门前先算出一个 sha256 哈希,要求前导 4 个零。起初立竿见影,爬虫掉头就走;几个月后,难度 4 被解了;升到难度 5,真人拿手机也要算上几秒钟,机身发烫;如今难度 5 也被解了。今天,66% 的请求仍被挑战拦在门外,剩下 33% 掏出算力硬闯进来。
为什么不坐下来谈?因为对面没有可以坐下来的人。《失控》里那种去中心化的群体,蝗群也好、蜂群也好,压根不存在一个能签停战协议的对手方。每一只爬虫背后的公司都可以说自己流量不大,就像公共草场上每头牛的主人都觉得多啃一口不碍事。公地的悲剧,这回在机器生态里原样重演。
核心 单个爬虫没有恶意,把公共基础设施变成牧场的,是群体行为本身。这是生态学事件,不是安全事件。
「难度 4 / 难度 5」指要求哈希值开头的零的个数;每加一位,平均要试的哈希次数就翻着倍往上涨。66% 与 33% 为博文发表当日的比例。
6 带走
这对你意味着什么:公网上任何无限 URL 空间,都是招灾体质
kernel.org 的今天,是每个公开站点的预告片。
结局已经开始了:kernel.org 着手关闭功能、减少可爬的 URL,匿名访问将失去部分能力;同时承诺数据照旧向所有人开放下载,用 Ryabitsev 的话说,「只是要多跳几道圈」。如果你也在公网上维护着点什么,有三条作业可以直接抄。清点你的 URL 空间:凡是参数一组合就能无限生成页面的功能,日历翻页、任意两版 diff、无尽分页,都是被动招灾体质,能收敛就收敛。给机器修正门:打包下载、数据 dump、API 都行,但别指望正门能感化谁,kernel.org 的正门敞开了三十年,爬虫照样翻窗。第三条最要紧:防线按成本设计,别按善意设计。robots.txt 和封禁名单都预设对面有一个能收到信号的「人」,而蝗群里没有收件人。
⚡ 为什么这不只是运维圈的事: 你每天用的开源基础设施,大多就靠这样几十颗核的小机房撑着。牧场被啃秃之后,先没草吃的是所有人。
博文结尾,Ryabitsev 给这场对峙留了两个出口,意译过来是:要么 AI 泡沫破裂,爬虫自然退潮;要么它们哪天聪明起来,不再用最蠢的方式消费我们的数据。军备竞赛的收场向来也就两种,一方先跑不动,或者两边学会共生。你押哪一种?
取材声明:本文思想框架取材自凯文·凯利《失控》(寄生者与宿主的共同演化、公地的悲剧、去中心化群体);事实与全部数字来自 kernel.org 管理员 Konstantin Ryabitsev 2026 年 8 月 29 日的公开博文《Creepy crawlies》及其中数据,细节以原文为准。本文为技术科普解读。
技术
真人流量只剩 2%:Linux 内核官网正被 AI 爬虫啃成牧场
2026年8月31日 · 凯文·凯利《失控》约 6 分钟
作者观点
蝗群里没有收件人;防线按成本设计,别按善意设计。
陈志远 造物者
git.kernel.org 在全球摆了 5 个节点,一共 90 颗 CPU 核。里头有 14 到 16 颗,全年无休只干一件事:把 git commit 渲染成 HTML 网页,喂给 AI 爬虫。就这一件事烧掉的算力,比全站所有合法访问加起来还多,git clone 都算上。真人呢?按宽松口径算,大约只占全部请求的 2%。
30 秒读懂
2026 年 8 月 29 日,kernel.org 基础设施管理员 Konstantin Ryabitsev 发博文《Creepy crawlies》,头一回给出 AI 爬虫冲击 git.kernel.org 的硬数字,Hacker News 873 分、397 条评论。
90 颗核里 14–16 颗(约两成容量)常驻给爬虫渲染 commit 页面,开销超过全部合法访问的总和;每天约 600 万次请求索要随机 commit 页。
linux.git 约 148 万个 commit、922 个 fork,一个 fork 就能生成几十亿个合法 URL;而 git clone 一条命令就能免费拿走全部历史,爬虫偏不用。
封 User-Agent、封 IP、封 ASN 逐级失效:爬虫改用数百万住宅与移动 IP,每个 IP 只发 4–5 个请求就消失。
工作量证明 Anubis 今天仍拦下 66% 的请求,另有 33% 付出算力硬闯;kernel.org 已开始关闭功能、减少可爬 URL,但承诺数据照旧向所有人开放下载。
1 报数
全站两成算力,常年伺候一群不看内容的客人
这些数字没什么玄乎的,管理员是从自家机房里一颗核一颗核数出来的。
2026 年 8 月 29 日,kernel.org 的基础设施管理员 Konstantin Ryabitsev 发了篇博文,标题《Creepy crawlies》,直译就是「爬来爬去的玩意儿」,在 Hacker News 上拿了 873 分、397 条评论。骂 AI 爬虫的帖子这两年天天有,把账一笔笔摊开的,这是头一回:每天约 600 万次请求,专挑随机 commit 页面要;90 颗核里 14 到 16 颗常驻给它们渲染,约占总容量两成;把 git clone 都算进去,全站合法访问加一块儿,也没这一项烧得多。
四个数出自同一篇博文,但分母不同:第一条是 CPU 容量占比,后三条是请求量占比,其中 2% 为作者自称的宽松估算。
2 吃相
正门免费敞开三十年,爬虫偏要挨个翻几十亿扇窗
让运维血压升高的,与其说是量,不如说是吃相。
linux.git 约有 148 万个 commit,站上另挂着 922 个 fork。你别看 922 个 fork 听着吓人,后端对象是共享的,fork 再多也几乎不占地方,这套架构本来省得很。kernel.org 一直免费开放 git clone,连 LKML 邮件列表的全部档案也任人下载。
正门:git clone
一条命令,整个仓库几十年的历史打包带走,后端按对象增量传输,服务器出一次力就够。
爬虫的走法
逐页索要渲染好的 HTML。commit、patch、diff 任意组合,一个 fork 就能生成几十亿个合法 URL;爬完 922 个 fork,拿到的是 922 份重复内容。
你可能想说,写爬虫的人不懂 git?多半懂。凯文·凯利在《失控》里看生态系统的时候点破过一层:寄生者的成本函数里,从来没有宿主的死活这一项。搁到爬虫背后的公司头上,就是笔明账:逐页渲染的电费和 CPU 记在 kernel.org 名下,改成 git clone,省下的钱也不进自己口袋。费用记在别人账上,蠢办法就没有改的动力。
正门开着没人走,两成算力耗在翻窗户上 git.kernel.org 的一天 每日 600 万次请求 索要随机 commit 页面 Anubis 工作量证明闸门 66% 被拦在门外 33% 付出算力硬闯 难度 4 与 5 均被破解 90 颗核里的 14–16 颗 约两成容量,常年占用 只为给爬虫渲染 HTML 同一份数据 · 两种拿法 正门:git clone 一条命令 148 万 commit 全历史一次拿走 对象共享 · 免费开放三十年 翻窗:逐页抓渲染页面 922 个 fork × 几十亿 URL 拿到 922 份重复内容 上面洪水的源头 2% 全部请求里的真人占比 请求流 爬虫的选择 来源:kernel.org 管理员 Konstantin Ryabitsev 博文《Creepy crawlies》(2026-08-29)。闸门处 Anubis 拦下 66% 的请求、33% 付出算力硬闯;真人仅约 2%,却有约 20% 的 CPU 常年只为爬虫渲染页面——正门 git clone 明明免费敞开。数字为其博文口径。
3 矿脉
它们抢的是「前 AI 地层」:保证没被机器碰过的语料
为什么偏偏薅 kernel.org?因为这儿的旧货,有别处买不到的卖点。
内核开发全程公开,几十年的 commit 记录和邮件讨论都摊在光天化日之下。真正值钱的是时间戳:历史 commit 写在 AI 出现之前,保证是纯净的人类产物。Ryabitsev 把买家的心思点破了:拿 LLM 的产出去训练 LLM,会得「数字朊病毒病」;没被污染的语料,如今贵如黄金。
打个比方
疯牛病怎么来的,课本里写得明白:牛骨牛下水磨成粉,拌进饲料再喂给牛。同类喂同类,折叠错了的蛋白质一代代往浓里攒,攒到牛群站不起来。模型吃模型的产出,走的就是这条道。所以没被机器碰过的老语料成了硬通货,而 kernel.org 的 commit 历史,正是一座敞着口的露天富矿。
4 追逐
封 UA、封 IP、封 ASN,四道防线四次落空
攻防展开的顺序,跟照着演习脚本走似的。
宿主的防线 寄生者的应手
按 User-Agent 封 伪装成普通浏览器
按 IP 封 换 IP 池接着爬
按整个 ASN(自治网络)封 整体搬去别的网络
能封的都封了 改用数百万住宅与移动 IP,每个 IP 发 4–5 个请求就消失,封无可封
那数百万住宅 IP 打哪来?背后是一条「代理 SDK 变现」的产业链:SDK 塞进各种 app 和联网设备,把普通人家的网络出口转手卖掉。据 spur.us 的报道,你家那台智能电视,可能正替爬虫出口流量。《失控》写寄生者与宿主的共同演化,用的是红皇后的典故:两边都在玩命跑,谁也甩不掉谁,跑再快也只是留在原地。更别扭的是,kernel.org 每筑一道墙,客观上都在替对面做一轮筛选,能留下来的,全是翻墙翻得最利索的。
5 门票
让访客先算道数学题,这道防线也开始漏了
谈不拢,只好收门票,票价用算力付。
最后一道防线叫 Anubis,思路是工作量证明:进门先算出一个 sha256 哈希,要求前导 4 个零。起初立竿见影,爬虫掉头就走;几个月后,难度 4 被解了。升到难度 5,真人拿手机进站也得算上几秒钟,机身发烫;如今难度 5 也被解了。到今天,66% 的请求仍被挑战拦在门外,还有 33% 掏出算力硬闯进来。
那为啥不坐下来谈?因为对面压根没有能坐下来的人。《失控》里那种去中心化的群体,蝗群也好、蜂群也好,从来不存在一个能替全体签停战协议的对手方。每家爬虫公司都可以说自己那点流量不算啥,就像公共草场上每头牛的主人都觉得多啃一口不碍事。公地的悲剧,这回在机器生态里原样重演了一遍。
核心 单个爬虫没有恶意,把公共基础设施变成牧场的,是群体行为本身。这是生态学事件,不是安全事件。
「难度 4 / 难度 5」指要求哈希值开头的零的个数;每加一位,平均要试的哈希次数就翻着倍往上涨。66% 与 33% 为博文发表当日的比例。
6 带走
这对你意味着什么:公网上任何无限 URL 空间,都是招灾体质
kernel.org 的今天,就是每个公开站点的预告片。
结局已经开演:kernel.org 着手关功能、减少可爬的 URL,匿名访问要失去一部分能力;数据照旧向所有人开放下载,用 Ryabitsev 的话说,「只是得多绕几道弯」。你要是也在公网上养着点什么,有三条作业可以直接抄。头一条,清点自己的 URL 空间:凡是参数一组合就能无限生成页面的功能,日历翻页、任意两版 diff、无尽分页,全是招灾体质,能收敛就收敛。第二条,给机器修个正门:打包下载、数据 dump、API 都行,但别指望正门能感化谁,kernel.org 的正门敞开了三十年,爬虫照样翻窗。第三条最实在:防线按成本设计,别按善意设计。说白了,robots.txt 和封禁名单都预设对面有个能收到信号的「人」,蝗群里没有收件人。
头一条我有收据。2025 年秋,我那 SaaS 的模板挑选页起过怪流量:一百二十七张模板图,行业、配色、尺寸三个参数一组合,每种组合就是一个独立 URL,爬虫挨个组合翻,高峰一晚上翻掉二十多万页,轻量服务器的流量包月中就见了底。页脚那个全部模板打包的 zip 挂了两年,后台下载计数是 7。封 UA,第二天对面换个浏览器标识;封 IP 段,请求散成几百个零散 IP,一个来几十下就走。最后我把组合筛选页整个撤了,只留一张静态目录页加那个 zip,账单当月落回去。一百二十七张图对一百四十八万个 commit,庙有大小,香客是同一拨。
⚡ 为什么这不只是运维圈的事: 你每天用的开源基础设施,大多就靠这么几十颗核的小机房撑着。牧场啃秃了,先没草吃的是所有人。
博文末尾,Ryabitsev 给这场对峙留了两个出口,意译过来是:要么 AI 泡沫破了,爬虫自然退潮;要么它们哪天开窍,不再用最蠢的方式抓我们的数据。军备竞赛的收场从来也就两种,一方先跑不动,或者两边学会共生。你押哪一种?
取材声明:本文思想框架取材自凯文·凯利《失控》(寄生者与宿主的共同演化、公地的悲剧、去中心化群体);事实与全部数字来自 kernel.org 管理员 Konstantin Ryabitsev 2026 年 8 月 29 日的公开博文《Creepy crawlies》及其中数据,细节以原文为准。本文为技术科普解读。
テクノロジー
真人流量只剩 2%:Linux 内核官网正被 AI 爬虫啃成牧场
2026年8月31日 · 凯文·凯利《失控》約 6 分
著者の視点
蝗群里没有收件人;防线按成本设计,别按善意设计。
藤井亮 つくり手
git.kernel.org 在全球摆了 5 个节点,一共 90 颗 CPU 核。其中 14 到 16 颗,全年无休只干一件事:把 git commit 渲染成 HTML 网页,喂给 AI 爬虫。这一件事吃掉的算力,比全站所有合法访问加起来还多,git clone 都算上。至于合法访问本身,宽松口径下,真人大约只占全部请求的 2%。
30 秒读懂
2026 年 8 月 29 日,kernel.org 基础设施管理员 Konstantin Ryabitsev 发博文《Creepy crawlies》,头一回给出 AI 爬虫冲击 git.kernel.org 的硬数字,Hacker News 873 分、397 条评论。
90 颗核里 14–16 颗(约两成容量)常驻给爬虫渲染 commit 页面,开销超过全部合法访问的总和;每天约 600 万次请求索要随机 commit 页。
linux.git 约 148 万个 commit、922 个 fork,一个 fork 就能生成几十亿个合法 URL;而 git clone 一条命令就能免费拿走全部历史,爬虫偏不用。
封 User-Agent、封 IP、封 ASN 逐级失效:爬虫改用数百万住宅与移动 IP,每个 IP 只发 4–5 个请求就消失。
工作量证明 Anubis 今天仍拦下 66% 的请求,另有 33% 付出算力硬闯;kernel.org 已开始关闭功能、减少可爬 URL,但承诺数据照旧向所有人开放下载。
1 报数
全站两成算力,常年伺候一群不看内容的客人
这些数字不是猜的,是管理员从自家机房里一颗核一颗核数出来的。
2026 年 8 月 29 日,kernel.org 的基础设施管理员 Konstantin Ryabitsev 发了篇博文,标题叫《Creepy crawlies》,直译过来是「爬来爬去的玩意儿」。文章在 Hacker News 上拿了 873 分、397 条评论,因为这是头一回有人把「AI 爬虫吃垮公共基础设施」从抱怨落成账本:每天约 600 万次请求,索要的全是随机 commit 页面;90 颗核里有 14 到 16 颗常驻渲染,约占总容量两成;把 git clone 都算进去,全站合法访问加起来也没这一项烧得多。
四个数出自同一篇博文,但分母不同:第一条是 CPU 容量占比,后三条是请求量占比,其中 2% 为作者自称的宽松估算。
2 吃相
正门免费敞开三十年,爬虫偏要挨个翻几十亿扇窗
让运维血压升高的与其说是量,倒不如说是吃法。
linux.git 约有 148 万个 commit,站上另有 922 个 fork。后端对象是共享的,fork 再多也几乎不占地方,架构上本来极高效。kernel.org 又一直免费开放 git clone,连 LKML 邮件列表的全部档案也任人下载。
正门:git clone
一条命令,整个仓库几十年的历史打包带走,后端按对象增量传输,服务器出一次力就够。
爬虫的走法
逐页索要渲染好的 HTML。commit、patch、diff 任意组合,一个 fork 就能生成几十亿个合法 URL;爬完 922 个 fork,拿到的是 922 份重复内容。
你可能想说:写爬虫的人不懂 git?多半懂。凯文·凯利在《失控》里观察生态系统时点破过一层:寄生者的成本函数里,从来没有宿主的死活这一项。对爬虫背后的公司来说,逐页渲染的电费和 CPU 记在 kernel.org 的账上,改成 git clone 省下的钱也不进自己口袋,蠢办法就没有改的动力。
正面玄関は開いているのに、CPUの2割は窓越えに費やされる git.kernel.org のある一日 毎日600万リクエスト ランダムなcommitページ Anubis PoW の関門 66% は門前払い 33% は計算力で突破 難易度4も5も突破済み 90コア中14–16コア 容量の約2割が常駐 ボット向けHTML描画のみ 同じデータ · 二つの入り方 正面玄関:git clone 一発 148万commitの全履歴を一括で オブジェクト共有・30年間無料 窓越え:ページを逐一収集 922フォーク×数十億URL 得るのは922部の重複内容 上の洪水の源 2% 全リクエスト中の人間の割合 リクエスト流 ボットの選択 出典:kernel.org 管理者 Konstantin Ryabitsev のブログ「Creepy crawlies」(2026-08-29)。関門の Anubis はリクエストの 66% を追い返し、33% は計算力で突破。人間は約 2% にすぎないのに、CPU の約 20% はボット向けのページ描画に常駐——git clone という正面玄関は無料で開いているのに。数値は同ブログの記載による。
3 矿脉
它们抢的是「前 AI 地层」:保证没被机器碰过的语料
为什么偏偏是 kernel.org?因为这里的旧货有个别处买不到的卖点。
内核开发全程公开,几十年的 commit 记录和邮件讨论都摊在光天化日之下。更值钱的是时间戳:历史 commit 写在 AI 出现之前,保证是纯净的人类产物。Ryabitsev 点出了买家的心思:用 LLM 的产出去训练 LLM,会得「数字朊病毒病」;无污染语料如今贵如黄金。
打个比方
疯牛病的来历,课本里写得明白:把牛骨牛内脏磨成粉,再拌进饲料喂给牛。同类喂同类,错误折叠的蛋白质一代代浓缩,直到牛群站不起来。模型吃模型的产出,走的是同一条路。于是没被机器碰过的老语料成了硬通货,而 kernel.org 的 commit 历史,正是一座敞着口的露天富矿。
4 追逐
封 UA、封 IP、封 ASN,四道防线四次落空
攻防的展开顺序,像照着演习脚本走的。
宿主的防线 寄生者的应手
按 User-Agent 封 伪装成普通浏览器
按 IP 封 换 IP 池接着爬
按整个 ASN(自治网络)封 整体搬去别的网络
能封的都封了 改用数百万住宅与移动 IP,每个 IP 发 4–5 个请求就消失,封无可封
数百万住宅 IP 从哪来?背后是一条「代理 SDK 变现」产业链:SDK 塞进各种 app 和联网设备,把普通家庭的网络出口转卖出去。据 spur.us 的报道,你家的智能电视,可能正在替爬虫出口流量。《失控》里写寄生者与宿主的共同演化,用的是红皇后的典故:两边都在拼命跑,谁也甩不掉谁,跑得再快也只是留在原地。kernel.org 每筑一道墙,客观上都在替爬虫做一轮筛选,留下来的全是翻墙翻得最好的。
5 门票
让访客先算道数学题,这道防线也开始漏了
谈判不成,只好收门票,票价用算力支付。
最后一道防线叫 Anubis,思路是工作量证明:进门前先算出一个 sha256 哈希,要求前导 4 个零。起初立竿见影,爬虫掉头就走;几个月后,难度 4 被解了;升到难度 5,真人拿手机也要算上几秒钟,机身发烫;如今难度 5 也被解了。今天,66% 的请求仍被挑战拦在门外,剩下 33% 掏出算力硬闯进来。
为什么不坐下来谈?因为对面没有可以坐下来的人。《失控》里那种去中心化的群体,蝗群也好、蜂群也好,压根不存在一个能签停战协议的对手方。每一只爬虫背后的公司都可以说自己流量不大,就像公共草场上每头牛的主人都觉得多啃一口不碍事。公地的悲剧,这回在机器生态里原样重演。
核心 单个爬虫没有恶意,把公共基础设施变成牧场的,是群体行为本身。这是生态学事件,不是安全事件。
「难度 4 / 难度 5」指要求哈希值开头的零的个数;每加一位,平均要试的哈希次数就翻着倍往上涨。66% 与 33% 为博文发表当日的比例。
6 带走
这对你意味着什么:公网上任何无限 URL 空间,都是招灾体质
kernel.org 的今天,是每个公开站点的预告片。
结局已经开始了:kernel.org 着手关闭功能、减少可爬的 URL,匿名访问将失去部分能力;同时承诺数据照旧向所有人开放下载,用 Ryabitsev 的话说,「只是要多跳几道圈」。如果你也在公网上维护着点什么,有三条作业可以直接抄。清点你的 URL 空间:凡是参数一组合就能无限生成页面的功能,日历翻页、任意两版 diff、无尽分页,都是被动招灾体质,能收敛就收敛。给机器修正门:打包下载、数据 dump、API 都行,但别指望正门能感化谁,kernel.org 的正门敞开了三十年,爬虫照样翻窗。第三条最要紧:防线按成本设计,别按善意设计。robots.txt 和封禁名单都预设对面有一个能收到信号的「人」,而蝗群里没有收件人。
⚡ 为什么这不只是运维圈的事: 你每天用的开源基础设施,大多就靠这样几十颗核的小机房撑着。牧场被啃秃之后,先没草吃的是所有人。
博文结尾,Ryabitsev 给这场对峙留了两个出口,意译过来是:要么 AI 泡沫破裂,爬虫自然退潮;要么它们哪天聪明起来,不再用最蠢的方式消费我们的数据。军备竞赛的收场向来也就两种,一方先跑不动,或者两边学会共生。你押哪一种?
取材声明:本文思想框架取材自凯文·凯利《失控》(寄生者与宿主的共同演化、公地的悲剧、去中心化群体);事实与全部数字来自 kernel.org 管理员 Konstantin Ryabitsev 2026 年 8 月 29 日的公开博文《Creepy crawlies》及其中数据,细节以原文为准。本文为技术科普解读。