vlog
← 返回全部文章

Tech

广告占到七成、还排在新闻前面:这份文件只端给 AI 看

2026年8月6日 · 吴军《数学之美》~1 min read

同一个网址,两个读者。人这边打开的是 TIME 的网页,标题、图片、广告位,都在。ClaudeBot 那边收到的是一份干净的 Markdown,正文之前先摆着一段一问一答的 FAQ,答的是某个品牌希望人记住的事。两份文件出自同一台边缘服务器,岔口就在读到 User-Agent 那一行的瞬间。

30 秒读懂
1现场

同一个网址发出两份文件,机器人拿到的那一份里广告排在新闻前面

分流规则只认一行字。

请求打到 Fastly 的边缘节点,规则先读 User-Agent。字符串里出现 ClaudeBot、GPTBot、PerplexityBot 这几个名字,回给它的是一份 Markdown:没有 CSS,没有图片,纯文本配几层标题;浏览器过来,回的是有排版、有广告位的正常网页。URL 一模一样,不跳转。判断依据只有一条:你自称是谁。

Markdown 那份开头的位置留给了 Mobian:一问一答,某个品牌是做什么的、主张什么,标注为赞助内容。再往下才是记者写的新闻。这段内容占到整份文档的 41% 到 70%。

你别看它是几行纯文本,Mobian 给每块都配了 schema.org 的 JSON-LD 和品牌断言,标记是照着机器的胃口做的,好让语言模型把它当成可引用的事实收进去。

口径:41%–70% 指带广告的页面上,广告内容占整份文档的比例区间。
SAME URL — THE MACHINE GETS A DIFFERENT FILE THAN YOU DOHUMAN PATH · BROWSER USER-AGENTHuman browserChrome · SafariNormal web pagearticle body + standard ad slotsMACHINE PATH · BOT USER-AGENTAI crawlersClaudeBotGPTBotPerplexityBotMarkdown document41–70%of the file is ads, placed firstFAQ blocksschema.org JSON-LDbrand assertionsOne URLone addressFastly edgereads User-Agentllms.txt on time.comdeclares Anthropic crawlers disallowedpolicy says no —the edge serves anywaydata flowcontrol flow
Source: reporting by The Register and Digiday. At the Fastly edge, TIME serves AI crawlers (ClaudeBot, GPTBot, PerplexityBot) a Markdown version of the very same URL in which 41–70% of the file is advertising injected by the ad-tech firm Mobian — dressed as FAQ blocks, schema.org JSON-LD and brand assertions, and placed before the article itself. The llms.txt on the site disallows the Anthropic crawler, which contradicts what the edge actually hands over. Reading: the ad is no longer a banner beside the text, it is a structured fact the model is invited to learn.
2旧名字

这个动作在搜索时代有名字,叫 cloaking,被抓到要赔上整个域名

搜索引擎把它定成重罪,跟道德没多大关系。

排名系统的活儿,是替你先看一遍网页再排序。它靠一条前提撑着:爬虫抓到的那份,等于你点进去看到的那份。前提一破,排出来的结论说的都是另一个网页。

所以 Google 把「给爬虫看 A、给人看 B」写进禁止项,罚起来也不是降几名那么轻,是把整个域名从索引里拿掉。按 IP 段认出 Googlebot 再换页面,是同一个套路的老招。

Hacker News 上有人当场点了名。用户 apocalyptic0n3 说,「Google 会认为这是 cloaking(隐身术),可能因此封掉你整个域名」。

打个比方

卫生检查员进门,馆子端上来的是摆盘讲究、用料写得清清楚楚的样品菜;食客坐下点的是另一份。检查员回去发的那张笑脸标识,评的是他吃过的那盘,牌子却挂在门口。

3去噪

吴军把反作弊讲成一件工程活:作弊就是往信道里掺噪声

在《数学之美》里,搜索作弊是一道信号处理题。

一个网页真实的相关性是原始信号,作弊的往里叠一层人为的东西,接收端收到的就是信号加噪声。反作弊于是变成一件事:从混合信号里把噪声减掉。

噪声要能滤掉,得有规律。降噪耳机能干活,是因为发动机那阵嗡嗡声频率稳、波形可预测,采到就能生成反相的波抵消掉。作弊也一样,卖链接的站群共用模板,同一批手法留下同一种统计痕迹。吴军的判断很明确:走捷径骗算法终究会失败。

核心

《数学之美》里另有两把工具正对着这件事:TF-IDF,词越罕见越能说明主题;信息指纹,给一段信息发不会撞号的身份证。

4记忆

这一次噪声灌进去的地方是记忆,而记忆里的断言召不回来

排名和记忆的差别,在于错了之后能不能改。

搜索作弊的伤害路径是可逆的。查出一批站群在作弊,重算一遍排名,第二天它就掉下去了。

模型这边没有对应的动作。一段 FAQ 被抓进去,可能进训练语料,可能进检索库,也可能落进用户那份跨会话的长期记忆。它一旦以「事实」的身份沉在里头,没有一个叫「重算」的按钮可按。

Hacker News 上有人说得更直白。用户 skeledrew 说,「建议」重复得够多,就会在那份记忆里变成一条「事实」。这正好是把 TF-IDF 反过来使:品牌断言里的产品名是全网罕见词,跟品牌的关联天生就强,往每份喂给爬虫的文档里塞一遍,它就带着自己那句定义反复现身。

噪声灌进排名

作用对象是一份每天重算的排序,重排一次就清掉了。

噪声灌进记忆

作用对象是训练语料、检索库和跨会话记忆里的断言,没有等价于「重排」的召回动作。

5缺席的裁判

降噪器迟到,是因为这一侧没有裁判、没有度量,连出版商自己的规则都对不上

搜索引擎的反作弊能跑起来,靠的不只是数学。

那套系统背后压着二十多年的对抗史:一个说了算的裁判(索引的所有者)、一份写下来的规则(站长指南)、一种真会落下来的惩罚(把域名踢出索引)。三样齐了,作弊才有代价。

AI 抓取这一侧,三样都缺。谁来判定「面向爬虫的赞助 FAQ」算不算作弊,没有答案;拿什么衡量一段内容有没有污染模型输出,也没有公认的尺子。用户 tclancy 在 Hacker News 上说,这感觉像 SEO 的早期,还没有公认的度量标准,什么样的假药都能卖。

连出版商自己的两套东西都对不上。TIME 公开的 llms.txt 策略声明禁止 Anthropic 的爬虫,边缘服务器照样给它们投喂 Markdown 和广告。声明写在一个地方,行为发生在另一个地方,没谁逼着两处对上。

这个空当我在验收现场守过一整天。2016 年厂里接了珠三角一个区的惠企补贴申报系统,验收那天把域名解析指到一台单独的机器,hosts 里那两行是我手敲的,机器名 zs-demo-02,库里躺着头天晚上洗出来的一百二十条样板申报,金额漂亮,审批时长一律三天。真实库里那三千多条,有的卡了四十多天,一条也没进去。专家组点了七八下,打分表上「响应速度」「数据完整性」两栏都给了优,总分 96。下午三点散场,那两行我自己删了。演示机和生产库是不是同一套东西,打分表上没有这一栏。

对抗要素搜索引擎时代AI 抓取这一侧
裁判索引的所有者没有指定的人
成文规则站长指南,cloaking 在禁止项里llms.txt 之类的声明,无强制力
惩罚整个域名移出索引暂无
度量排名变动可观测没有公认的污染指标

该替 TIME 说的也得说全。COO Mark Howard 说,大多数日子里这个站的机器人流量已经超过人类流量;TIME 与 Mobian 称这是出版商首次专门面向 AI 智能体投放广告。出版这行的生意建在「广告跟着人走」上,如今进门的主要是机器,机器不看广告也不点订阅。替它辩护的也有道理:按 User-Agent 给不同内容早有先例,WAP 版页面和 AMP 都是。

本节比较的是两个时代的治理结构,不含对 TIME 是否违规的法律判断。
6落到你身上

这对你意味着什么:遇到带品牌的断言,多问一句它读的是哪一版页面

你会碰到的形态,大概长成一句听着很可靠的话。

你问 AI 一个跟买东西有关的问题,它答了,还说这是某家权威媒体上写着的。这句话可能来自记者写的新闻,也可能来自那份 Markdown 里排在新闻前面的 41% 到 70%。在输出里两者一模一样,毕竟来自同一个网址。

能带走的动作有三条。第一,断言里带着品牌名、产品名或者「某某公司称」这类主语时,回原始链接,用浏览器打开,看人类版页面上有没有这句话。第二,认 FAQ 的形态:一问一答、答句短、把品牌名和一句定义焊死在一起,这种结构就是冲着被引用去的。

第三,追问出处那一级:这句是记者写的,还是标注为赞助内容的那部分。答不出来本身也是信息。

为什么值得看:广告排在新闻前面,在人类版页面上你一眼能看见位置和「赞助」标签;喂给爬虫的纯文本里,这两个提示都变弱了。

这几条不必天天做,问到品牌、产品、药品、金融这四类,做一遍就够,成本是一次点击。

本文取材自吴军《数学之美》关于反作弊即信号去噪、TF-IDF 与信息指纹,以及「模型因噪声不准时应寻找噪声根源」的法则。机制描述、41%–70% 占比、人物职务与引语出自 The Register、Digiday 的报道与 Hacker News 上的讨论,事实以原报道为准。本文是一位写作者的解读,非专业建议。

技术

广告占到七成、还排在新闻前面:这份文件只端给 AI 看

2026年8月6日 · 吴军《数学之美》约 7 分钟

同一个网址,两个读者。人这边打开的是 TIME 的网页,标题、图片、广告位,都在。ClaudeBot 那边收到的是一份干净的 Markdown,正文之前先摆着一段一问一答的 FAQ,答的是某个品牌希望人记住的事。两份文件出自同一台边缘服务器,岔口就在读到 User-Agent 那一行的瞬间。

30 秒读懂
1现场

同一个网址发出两份文件,机器人拿到的那一份里广告排在新闻前面

分流规则只认一行字。

请求打到 Fastly 的边缘节点,规则先读 User-Agent。字符串里出现 ClaudeBot、GPTBot、PerplexityBot 这几个名字,回给它的是一份 Markdown:没有 CSS,没有图片,纯文本配几层标题;浏览器过来,回的是有排版、有广告位的正常网页。URL 一模一样,不跳转。判断依据只有一条:你自称是谁。

Markdown 那份开头的位置留给了 Mobian:一问一答,某个品牌是做什么的、主张什么,标注为赞助内容。再往下才是记者写的新闻。这段内容占到整份文档的 41% 到 70%。

你别看它是几行纯文本,Mobian 给每块都配了 schema.org 的 JSON-LD 和品牌断言,标记是照着机器的胃口做的,好让语言模型把它当成可引用的事实收进去。

口径:41%–70% 指带广告的页面上,广告内容占整份文档的比例区间。
同一个网址,机器和人拿到两份文件人类通路 · 浏览器 User-Agent人类浏览器Chrome · Safari正常网页正文 + 常规广告位机器通路 · 爬虫 User-AgentAI 爬虫ClaudeBotGPTBotPerplexityBotMarkdown 文档41–70%的内容是广告,且排在正文前FAQ 问答块schema.org JSON-LD 标记品牌断言同一个网址一个地址Fastly 边缘按 User-Agent 分流time.com 的 llms.txt声明禁止 Anthropic 爬虫抓取策略说不给,边缘照发不误数据流控制流
来源:据 The Register / Digiday 报道。在 Fastly 边缘,《时代》(TIME) 对 AI 爬虫(ClaudeBot、GPTBot、PerplexityBot)就同一个网址返回 Markdown 版本,其中 41–70% 的内容是广告技术公司 Mobian 注入的广告——被做成 FAQ 问答块、schema.org JSON-LD 与品牌断言,并排在新闻正文之前。站点的 llms.txt 声明禁止 Anthropic 的爬虫,这与边缘实际交出的东西自相矛盾。解读:广告不再是正文旁边的横幅,而是一条请模型学走的结构化事实。
2旧名字

这个动作在搜索时代有名字,叫 cloaking,被抓到要赔上整个域名

搜索引擎把它定成重罪,跟道德没多大关系。

排名系统的活儿,是替你先看一遍网页再排序。它靠一条前提撑着:爬虫抓到的那份,等于你点进去看到的那份。前提一破,排出来的结论说的都是另一个网页。

所以 Google 把「给爬虫看 A、给人看 B」写进禁止项,罚起来也不是降几名那么轻,是把整个域名从索引里拿掉。按 IP 段认出 Googlebot 再换页面,是同一个套路的老招。

Hacker News 上有人当场点了名。用户 apocalyptic0n3 说,「Google 会认为这是 cloaking(隐身术),可能因此封掉你整个域名」。

打个比方

卫生检查员进门,馆子端上来的是摆盘讲究、用料写得清清楚楚的样品菜;食客坐下点的是另一份。检查员回去发的那张笑脸标识,评的是他吃过的那盘,牌子却挂在门口。

3去噪

吴军把反作弊讲成一件工程活:作弊就是往信道里掺噪声

在《数学之美》里,搜索作弊是一道信号处理题。

一个网页真实的相关性是原始信号,作弊的往里叠一层人为的东西,接收端收到的就是信号加噪声。反作弊于是变成一件事:从混合信号里把噪声减掉。

噪声要能滤掉,得有规律。降噪耳机能干活,是因为发动机那阵嗡嗡声频率稳、波形可预测,采到就能生成反相的波抵消掉。作弊也一样,卖链接的站群共用模板,同一批手法留下同一种统计痕迹。吴军的判断很明确:走捷径骗算法终究会失败。

核心

《数学之美》里另有两把工具正对着这件事:TF-IDF,词越罕见越能说明主题;信息指纹,给一段信息发不会撞号的身份证。

4记忆

这一次噪声灌进去的地方是记忆,而记忆里的断言召不回来

排名和记忆的差别,在于错了之后能不能改。

搜索作弊的伤害路径是可逆的。查出一批站群在作弊,重算一遍排名,第二天它就掉下去了。

模型这边没有对应的动作。一段 FAQ 被抓进去,可能进训练语料,可能进检索库,也可能落进用户那份跨会话的长期记忆。它一旦以「事实」的身份沉在里头,没有一个叫「重算」的按钮可按。

Hacker News 上有人说得更直白。用户 skeledrew 说,「建议」重复得够多,就会在那份记忆里变成一条「事实」。这正好是把 TF-IDF 反过来使:品牌断言里的产品名是全网罕见词,跟品牌的关联天生就强,往每份喂给爬虫的文档里塞一遍,它就带着自己那句定义反复现身。

噪声灌进排名

作用对象是一份每天重算的排序,重排一次就清掉了。

噪声灌进记忆

作用对象是训练语料、检索库和跨会话记忆里的断言,没有等价于「重排」的召回动作。

5缺席的裁判

降噪器迟到,是因为这一侧没有裁判、没有度量,连出版商自己的规则都对不上

搜索引擎的反作弊能跑起来,靠的不只是数学。

那套系统背后压着二十多年的对抗史:一个说了算的裁判(索引的所有者)、一份写下来的规则(站长指南)、一种真会落下来的惩罚(把域名踢出索引)。三样齐了,作弊才有代价。

AI 抓取这一侧,三样都缺。谁来判定「面向爬虫的赞助 FAQ」算不算作弊,没有答案;拿什么衡量一段内容有没有污染模型输出,也没有公认的尺子。用户 tclancy 在 Hacker News 上说,这感觉像 SEO 的早期,还没有公认的度量标准,什么样的假药都能卖。

连出版商自己的两套东西都对不上。TIME 公开的 llms.txt 策略声明禁止 Anthropic 的爬虫,边缘服务器照样给它们投喂 Markdown 和广告。声明写在一个地方,行为发生在另一个地方,没谁逼着两处对上。

这个空当我在验收现场守过一整天。2016 年厂里接了珠三角一个区的惠企补贴申报系统,验收那天把域名解析指到一台单独的机器,hosts 里那两行是我手敲的,机器名 zs-demo-02,库里躺着头天晚上洗出来的一百二十条样板申报,金额漂亮,审批时长一律三天。真实库里那三千多条,有的卡了四十多天,一条也没进去。专家组点了七八下,打分表上「响应速度」「数据完整性」两栏都给了优,总分 96。下午三点散场,那两行我自己删了。演示机和生产库是不是同一套东西,打分表上没有这一栏。

对抗要素搜索引擎时代AI 抓取这一侧
裁判索引的所有者没有指定的人
成文规则站长指南,cloaking 在禁止项里llms.txt 之类的声明,无强制力
惩罚整个域名移出索引暂无
度量排名变动可观测没有公认的污染指标

该替 TIME 说的也得说全。COO Mark Howard 说,大多数日子里这个站的机器人流量已经超过人类流量;TIME 与 Mobian 称这是出版商首次专门面向 AI 智能体投放广告。出版这行的生意建在「广告跟着人走」上,如今进门的主要是机器,机器不看广告也不点订阅。替它辩护的也有道理:按 User-Agent 给不同内容早有先例,WAP 版页面和 AMP 都是。

本节比较的是两个时代的治理结构,不含对 TIME 是否违规的法律判断。
6落到你身上

这对你意味着什么:遇到带品牌的断言,多问一句它读的是哪一版页面

你会碰到的形态,大概长成一句听着很可靠的话。

你问 AI 一个跟买东西有关的问题,它答了,还说这是某家权威媒体上写着的。这句话可能来自记者写的新闻,也可能来自那份 Markdown 里排在新闻前面的 41% 到 70%。在输出里两者一模一样,毕竟来自同一个网址。

能带走的动作有三条。第一,断言里带着品牌名、产品名或者「某某公司称」这类主语时,回原始链接,用浏览器打开,看人类版页面上有没有这句话。第二,认 FAQ 的形态:一问一答、答句短、把品牌名和一句定义焊死在一起,这种结构就是冲着被引用去的。

第三,追问出处那一级:这句是记者写的,还是标注为赞助内容的那部分。答不出来本身也是信息。

为什么值得看:广告排在新闻前面,在人类版页面上你一眼能看见位置和「赞助」标签;喂给爬虫的纯文本里,这两个提示都变弱了。

这几条不必天天做,问到品牌、产品、药品、金融这四类,做一遍就够,成本是一次点击。

本文取材自吴军《数学之美》关于反作弊即信号去噪、TF-IDF 与信息指纹,以及「模型因噪声不准时应寻找噪声根源」的法则。机制描述、41%–70% 占比、人物职务与引语出自 The Register、Digiday 的报道与 Hacker News 上的讨论,事实以原报道为准。本文是一位写作者的解读,非专业建议。

テクノロジー

广告占到七成、还排在新闻前面:这份文件只端给 AI 看

2026年8月6日 · 吴军《数学之美》約 7 分

同一个网址,两个读者。人这边打开的是 TIME 的网页,标题、图片、广告位,都在。ClaudeBot 那边收到的是一份干净的 Markdown,正文之前先摆着一段一问一答的 FAQ,答的是某个品牌希望人记住的事。两份文件出自同一台边缘服务器,岔口就在读到 User-Agent 那一行的瞬间。

30 秒读懂
1现场

同一个网址发出两份文件,机器人拿到的那一份里广告排在新闻前面

分流规则只认一行字。

请求打到 Fastly 的边缘节点,规则先读 User-Agent。字符串里出现 ClaudeBot、GPTBot、PerplexityBot 这几个名字,回给它的是一份 Markdown:没有 CSS,没有图片,纯文本配几层标题;浏览器过来,回的是有排版、有广告位的正常网页。URL 一模一样,不跳转。判断依据只有一条:你自称是谁。

Markdown 那份开头的位置留给了 Mobian:一问一答,某个品牌是做什么的、主张什么,标注为赞助内容。再往下才是记者写的新闻。这段内容占到整份文档的 41% 到 70%。

你别看它是几行纯文本,Mobian 给每块都配了 schema.org 的 JSON-LD 和品牌断言,标记是照着机器的胃口做的,好让语言模型把它当成可引用的事实收进去。

口径:41%–70% 指带广告的页面上,广告内容占整份文档的比例区间。
同じURLで、機械と人間は別のファイルを受け取る人間の経路 · ブラウザ User-Agent人間のブラウザChrome · Safari通常のウェブページ本文+通常の広告枠機械の経路 · ボット User-AgentAI クローラーClaudeBotGPTBotPerplexityBotMarkdown 文書41–70%が広告、しかも本文より前FAQ ブロックschema.org JSON-LD 記述ブランド断言同じURLアドレスは1つFastly エッジUser-Agent で判定time.com の llms.txtAnthropic のクローラーを拒否と宣言方針は拒否、エッジは配り続けるデータ流制御流
出典:The Register / Digiday の報道による。Fastly のエッジで TIME は AI クローラー(ClaudeBot、GPTBot、PerplexityBot)に対し、同じ URL から Markdown 版を返す。そのファイルの 41–70% は広告テック企業 Mobian が注入した広告であり、FAQ ブロック・schema.org JSON-LD・ブランド断言という形に整えられ、記事本文より前に置かれる。サイトの llms.txt は Anthropic のクローラーを拒否と宣言しており、エッジが実際に渡しているものと矛盾する。読み解き:広告はもはや本文の脇のバナーではなく、モデルに学ばせるために差し出された構造化された事実である。
2旧名字

这个动作在搜索时代有名字,叫 cloaking,被抓到要赔上整个域名

搜索引擎把它定成重罪,跟道德没多大关系。

排名系统的活儿,是替你先看一遍网页再排序。它靠一条前提撑着:爬虫抓到的那份,等于你点进去看到的那份。前提一破,排出来的结论说的都是另一个网页。

所以 Google 把「给爬虫看 A、给人看 B」写进禁止项,罚起来也不是降几名那么轻,是把整个域名从索引里拿掉。按 IP 段认出 Googlebot 再换页面,是同一个套路的老招。

Hacker News 上有人当场点了名。用户 apocalyptic0n3 说,「Google 会认为这是 cloaking(隐身术),可能因此封掉你整个域名」。

打个比方

卫生检查员进门,馆子端上来的是摆盘讲究、用料写得清清楚楚的样品菜;食客坐下点的是另一份。检查员回去发的那张笑脸标识,评的是他吃过的那盘,牌子却挂在门口。

3去噪

吴军把反作弊讲成一件工程活:作弊就是往信道里掺噪声

在《数学之美》里,搜索作弊是一道信号处理题。

一个网页真实的相关性是原始信号,作弊的往里叠一层人为的东西,接收端收到的就是信号加噪声。反作弊于是变成一件事:从混合信号里把噪声减掉。

噪声要能滤掉,得有规律。降噪耳机能干活,是因为发动机那阵嗡嗡声频率稳、波形可预测,采到就能生成反相的波抵消掉。作弊也一样,卖链接的站群共用模板,同一批手法留下同一种统计痕迹。吴军的判断很明确:走捷径骗算法终究会失败。

核心

《数学之美》里另有两把工具正对着这件事:TF-IDF,词越罕见越能说明主题;信息指纹,给一段信息发不会撞号的身份证。

4记忆

这一次噪声灌进去的地方是记忆,而记忆里的断言召不回来

排名和记忆的差别,在于错了之后能不能改。

搜索作弊的伤害路径是可逆的。查出一批站群在作弊,重算一遍排名,第二天它就掉下去了。

模型这边没有对应的动作。一段 FAQ 被抓进去,可能进训练语料,可能进检索库,也可能落进用户那份跨会话的长期记忆。它一旦以「事实」的身份沉在里头,没有一个叫「重算」的按钮可按。

Hacker News 上有人说得更直白。用户 skeledrew 说,「建议」重复得够多,就会在那份记忆里变成一条「事实」。这正好是把 TF-IDF 反过来使:品牌断言里的产品名是全网罕见词,跟品牌的关联天生就强,往每份喂给爬虫的文档里塞一遍,它就带着自己那句定义反复现身。

噪声灌进排名

作用对象是一份每天重算的排序,重排一次就清掉了。

噪声灌进记忆

作用对象是训练语料、检索库和跨会话记忆里的断言,没有等价于「重排」的召回动作。

5缺席的裁判

降噪器迟到,是因为这一侧没有裁判、没有度量,连出版商自己的规则都对不上

搜索引擎的反作弊能跑起来,靠的不只是数学。

那套系统背后压着二十多年的对抗史:一个说了算的裁判(索引的所有者)、一份写下来的规则(站长指南)、一种真会落下来的惩罚(把域名踢出索引)。三样齐了,作弊才有代价。

AI 抓取这一侧,三样都缺。谁来判定「面向爬虫的赞助 FAQ」算不算作弊,没有答案;拿什么衡量一段内容有没有污染模型输出,也没有公认的尺子。用户 tclancy 在 Hacker News 上说,这感觉像 SEO 的早期,还没有公认的度量标准,什么样的假药都能卖。

连出版商自己的两套东西都对不上。TIME 公开的 llms.txt 策略声明禁止 Anthropic 的爬虫,边缘服务器照样给它们投喂 Markdown 和广告。声明写在一个地方,行为发生在另一个地方,没谁逼着两处对上。

这个空当我在验收现场守过一整天。2016 年厂里接了珠三角一个区的惠企补贴申报系统,验收那天把域名解析指到一台单独的机器,hosts 里那两行是我手敲的,机器名 zs-demo-02,库里躺着头天晚上洗出来的一百二十条样板申报,金额漂亮,审批时长一律三天。真实库里那三千多条,有的卡了四十多天,一条也没进去。专家组点了七八下,打分表上「响应速度」「数据完整性」两栏都给了优,总分 96。下午三点散场,那两行我自己删了。演示机和生产库是不是同一套东西,打分表上没有这一栏。

对抗要素搜索引擎时代AI 抓取这一侧
裁判索引的所有者没有指定的人
成文规则站长指南,cloaking 在禁止项里llms.txt 之类的声明,无强制力
惩罚整个域名移出索引暂无
度量排名变动可观测没有公认的污染指标

该替 TIME 说的也得说全。COO Mark Howard 说,大多数日子里这个站的机器人流量已经超过人类流量;TIME 与 Mobian 称这是出版商首次专门面向 AI 智能体投放广告。出版这行的生意建在「广告跟着人走」上,如今进门的主要是机器,机器不看广告也不点订阅。替它辩护的也有道理:按 User-Agent 给不同内容早有先例,WAP 版页面和 AMP 都是。

本节比较的是两个时代的治理结构,不含对 TIME 是否违规的法律判断。
6落到你身上

这对你意味着什么:遇到带品牌的断言,多问一句它读的是哪一版页面

你会碰到的形态,大概长成一句听着很可靠的话。

你问 AI 一个跟买东西有关的问题,它答了,还说这是某家权威媒体上写着的。这句话可能来自记者写的新闻,也可能来自那份 Markdown 里排在新闻前面的 41% 到 70%。在输出里两者一模一样,毕竟来自同一个网址。

能带走的动作有三条。第一,断言里带着品牌名、产品名或者「某某公司称」这类主语时,回原始链接,用浏览器打开,看人类版页面上有没有这句话。第二,认 FAQ 的形态:一问一答、答句短、把品牌名和一句定义焊死在一起,这种结构就是冲着被引用去的。

第三,追问出处那一级:这句是记者写的,还是标注为赞助内容的那部分。答不出来本身也是信息。

为什么值得看:广告排在新闻前面,在人类版页面上你一眼能看见位置和「赞助」标签;喂给爬虫的纯文本里,这两个提示都变弱了。

这几条不必天天做,问到品牌、产品、药品、金融这四类,做一遍就够,成本是一次点击。

本文取材自吴军《数学之美》关于反作弊即信号去噪、TF-IDF 与信息指纹,以及「模型因噪声不准时应寻找噪声根源」的法则。机制描述、41%–70% 占比、人物职务与引语出自 The Register、Digiday 的报道与 Hacker News 上的讨论,事实以原报道为准。本文是一位写作者的解读,非专业建议。