vlog
← 返回全部文章

Tech

「把按钮改成蓝色,别的什么都别动」:一个玩笑网站一夜冲上 HN 第一,388 条评论吵的是「我天天遇到」对「我从没遇到过」

2026年9月10日 · 刘未鹏《暗时间》~1 min read

「把一个按钮改成蓝色。别的什么都别动。」这是 opusfived.dev 开场给你的唯一指令。九月九日,这个单页网站被贴上 Hacker News,标题叫《Claude,把「加入购物车」按钮改成蓝色》。当天 969 分、388 条评论,首页第一,第二名 854 分。网站是个玩笑,评论区吵成那样可不是。

30 秒读懂
1这事儿

一个玩笑网站冲上首页第一,靠的是把最简单的一句指令演成灾难片

网站自己写得明明白白:这是喜剧。

形式很轻。读者在若干条预设回复里点选,看那个助手一路把「改一个按钮颜色」滚成重构、派子代理、跑对抗性评审。

你别看它是个段子,其实那 969 分不全是笑出来的。388 条评论里,多数人在干同一件事:认领,或者否认。

⚡

为什么值得看:它不做评测、不跑基准,一个数字都不来自受控实验,却把平时藏在各人机器里的事翻上台面:同一个工具,两拨人报的体验对不上。

2两派

一半人说这就是我每天的日子,另一半人说我一次都没碰见过

两边都不客气,互相都觉得对方在胡说。

brazukadev 的大意是:这正是他用 Opus 5 的体验,Opus 4.6 好些,Fable 5.1 好得多,Opus 5 让人火大。这属于个人观感,谈不上测量。Sohcahtoa82 说本该两行的 bug 修复变成加三个函数、总共一百行。empath75 说你要是由着它,Claude 是个不得了的 yak shaver(为了做 A 先去做 B、再去做 C 的那种人)。azalemeth 说「我错了」和「老实说」这两句话,对他已经死了。

另一边同样干脆。apetresc 说这站点就是同人文;drcongo 反问:得是什么样的代码库才会有这个问题;catapart 说这些预设提示词都不是他会用的说法,garbage in, garbage out。

A 派:这就是我的日常

8cvor6j844qw_d6 说它派出子代理做对抗性评审,其实一个 grep 或 diff 就够了;andremendes 的笑点是它终于做对了那一刻,然后给按钮加了个从没人要的渐变。

B 派:我从没遇到过

kstenerud、drcongo、llm_nerd 都说没见过这种行为;satvikpendem 说好笑但不真实,Opus 5、Fable 这一代已经能只改该改的。

SAME TOOL, TWO DISJOINT SAMPLES — NEITHER SIDE CAN SETTLE ITOne tool, one modelwhat both camps are describingPERSON A · ONE PRIVATE SAMPLEPERSON B · ANOTHER PRIVATE SAMPLEprompt wordingsetting Amodel versionsetting Acodebasesetting Aharness (the outer scaffolding)setting ACLAUDE.mdsetting Aprompt wordingsetting Bmodel versionsetting Bcodebasesetting Bharness (the outer scaffolding)setting BCLAUDE.mdsetting B“I hit this every single day.”“I have never once seen it.”one person's path to a verdictthe two samples never meetHacker News · 2026-09-09969 points · 388 comments
Source: opusfived.dev, an interactive comedy page, discussed on Hacker News on 2026-09-09 (969 points, 388 comments). Reading: one tool draws two opposite verdicts because each person only ever sees their own sample, and that sample is shaped by prompt wording, model version, codebase, harness (the outer scaffolding) and CLAUDE.md. Limits: this is comedy and satire, not a benchmark — neither side has controlled data.
3解释

ceejayoz 那条评论把两边都说通了:你们根本不在同一个输入分布上

他自己写过一层 harness,就为了不让这类输出烦到自己。

他那条的大意是:个人与个人之间差异很大,取决于你的 harness、你说话的方式、存储的记忆、你的 CLAUDE.md。harness 就是外层脚手架,套在模型外面替你管上下文、规则和流程。刘未鹏在《暗时间》里讲过个人经验的取样偏差:每个人手上只有自己那一份样本。这份样本被提示词、模型版本、代码库、harness、CLAUDE.md 一道道调制过,「我天天遇到」和「我从没遇到过」可以同时为真——两句话说的压根不是同一个输入分布。

2016 年厂里接了珠三角一个区的惠企补贴申报系统。验收那天上午,域名解析指到一台单独的机器,机器名 zs-demo-02,库里躺着头天晚上洗出来的一百二十条样板申报。专家组点了七八下,打分表上总分 96。生产库里那三千多条,有的卡了四十多天,一条也没进去。专家组带走的截图,跟窗口前排队的人看到的界面不是同一套东西。这场吵也一样:两拨人手里的机器名不一样。

kaoD 的抱怨不一样:它会顺手报出 200 个他没注意的问题,那些确实是坏的,于是被带偏的是他自己。cub-creature 说自己本来就容易越做越多,现在得刻意压着,别被它说服成「所有东西现在就修」。

核心

ceejayoz 点的四个变量(harness、说话方式、存储的记忆、CLAUDE.md)全在用户这一侧。388 条评论里没有一条把这四样一起报出来过。

4带走

这对你意味着什么:把「我的体验」变成别人能照着复核的东西

吵了 388 条,两边谁都没交出可复现的样本。

2001 年我爸进过一批「全新」继电器,其实是打磨翻新的货。一个开维修部的老客户没跟他争谁的感觉准,从兜里摸出放大镜看丝印,字体不对,当场退货。之后柜台常年备一瓶丙酮,擦一下丝印,翻新的立刻露馅。那瓶丙酮值钱在于:谁都能拿去擦,擦完结论一样。

说白了,个人体验裁不了这种争论。三条今天就能做。

① 下回你要抱怨或者要夸,把模型版本、有没有 harness、CLAUDE.md 多长、代码库多大、原样的那句提示词一起贴上。少一样就复核不了。

② 最省事的一条回复只有一行:RGS1811 回的是 /model claude-opus-4-7。换一个变量再看,比吵一晚上快。

③ 别拿别人的样本当自己的结论。felixgallo 就在讽刺底下那批「哇,看来我该换 OpenAI 了」的评论「很有机」。

口径:文中引语均为 Hacker News 评论大意,不是原文照录;「Opus 5 比 4.6 差」一类是个人观感,没有测量支撑。

下回你想说「Claude 就是这样」或者「Claude 不是这样」,先看一眼上面那五样跟没跟着一起贴。没贴,那句话就只对你自己成立。

取材声明:本文思想框架取材自刘未鹏《暗时间》(个人经验的取样偏差、经验的不可传递);事件与引语来自 opusfived.dev 原站与 2026 年 9 月 9 日的 Hacker News 讨论。该网站是喜剧与讽刺,不是评测,没有受控实验数据;引语均为评论大意,「Opus 5 比 4.6 差」是个人观感而非测量结果;两派都只有各自的使用经验,没有一方给出可复现的样本。细节以原站与原帖为准。

技术

「把按钮改成蓝色,别的什么都别动」:一个玩笑网站一夜冲上 HN 第一,388 条评论吵的是「我天天遇到」对「我从没遇到过」

2026年9月10日 · 刘未鹏《暗时间》约 5 分钟

「把一个按钮改成蓝色。别的什么都别动。」这是 opusfived.dev 开场给你的唯一指令。九月九日,这个单页网站被贴上 Hacker News,标题叫《Claude,把「加入购物车」按钮改成蓝色》。当天 969 分、388 条评论,首页第一,第二名 854 分。网站是个玩笑,评论区吵成那样可不是。

30 秒读懂
1这事儿

一个玩笑网站冲上首页第一,靠的是把最简单的一句指令演成灾难片

网站自己写得明明白白:这是喜剧。

形式很轻。读者在若干条预设回复里点选,看那个助手一路把「改一个按钮颜色」滚成重构、派子代理、跑对抗性评审。

你别看它是个段子,其实那 969 分不全是笑出来的。388 条评论里,多数人在干同一件事:认领,或者否认。

⚡

为什么值得看:它不做评测、不跑基准,一个数字都不来自受控实验,却把平时藏在各人机器里的事翻上台面:同一个工具,两拨人报的体验对不上。

2两派

一半人说这就是我每天的日子,另一半人说我一次都没碰见过

两边都不客气,互相都觉得对方在胡说。

brazukadev 的大意是:这正是他用 Opus 5 的体验,Opus 4.6 好些,Fable 5.1 好得多,Opus 5 让人火大。这属于个人观感,谈不上测量。Sohcahtoa82 说本该两行的 bug 修复变成加三个函数、总共一百行。empath75 说你要是由着它,Claude 是个不得了的 yak shaver(为了做 A 先去做 B、再去做 C 的那种人)。azalemeth 说「我错了」和「老实说」这两句话,对他已经死了。

另一边同样干脆。apetresc 说这站点就是同人文;drcongo 反问:得是什么样的代码库才会有这个问题;catapart 说这些预设提示词都不是他会用的说法,garbage in, garbage out。

A 派:这就是我的日常

8cvor6j844qw_d6 说它派出子代理做对抗性评审,其实一个 grep 或 diff 就够了;andremendes 的笑点是它终于做对了那一刻,然后给按钮加了个从没人要的渐变。

B 派:我从没遇到过

kstenerud、drcongo、llm_nerd 都说没见过这种行为;satvikpendem 说好笑但不真实,Opus 5、Fable 这一代已经能只改该改的。

同一个工具,两份互不相交的样本——两派谁也裁决不了同一个工具,同一个模型两派描述的是同一个对象个人 A · 一份私人样本个人 B · 另一份私人样本提示词的说法取值 A模型版本取值 A代码库取值 Aharness(外层脚手架)取值 ACLAUDE.md取值 A提示词的说法取值 B模型版本取值 B代码库取值 Bharness(外层脚手架)取值 BCLAUDE.md取值 B「我天天遇到」「我从没遇到过」一个人走到结论的路径两份样本从不相交Hacker News · 2026-09-09969 分 · 388 条评论
来源:互动喜剧页面 opusfived.dev,2026-09-09 在 Hacker News 引发讨论(969 分、388 条评论)。解读:同一个工具之所以得出两个相反结论,是因为每个人只看得见自己那一份样本,而这份样本被提示词的说法、模型版本、代码库、harness(外层脚手架)与 CLAUDE.md 调制过。边界:这是喜剧与讽刺,不是评测,两派都没有受控数据。
3解释

ceejayoz 那条评论把两边都说通了:你们根本不在同一个输入分布上

他自己写过一层 harness,就为了不让这类输出烦到自己。

他那条的大意是:个人与个人之间差异很大,取决于你的 harness、你说话的方式、存储的记忆、你的 CLAUDE.md。harness 就是外层脚手架,套在模型外面替你管上下文、规则和流程。刘未鹏在《暗时间》里讲过个人经验的取样偏差:每个人手上只有自己那一份样本。这份样本被提示词、模型版本、代码库、harness、CLAUDE.md 一道道调制过,「我天天遇到」和「我从没遇到过」可以同时为真——两句话说的压根不是同一个输入分布。

2016 年厂里接了珠三角一个区的惠企补贴申报系统。验收那天上午,域名解析指到一台单独的机器,机器名 zs-demo-02,库里躺着头天晚上洗出来的一百二十条样板申报。专家组点了七八下,打分表上总分 96。生产库里那三千多条,有的卡了四十多天,一条也没进去。专家组带走的截图,跟窗口前排队的人看到的界面不是同一套东西。这场吵也一样:两拨人手里的机器名不一样。

kaoD 的抱怨不一样:它会顺手报出 200 个他没注意的问题,那些确实是坏的,于是被带偏的是他自己。cub-creature 说自己本来就容易越做越多,现在得刻意压着,别被它说服成「所有东西现在就修」。

核心

ceejayoz 点的四个变量(harness、说话方式、存储的记忆、CLAUDE.md)全在用户这一侧。388 条评论里没有一条把这四样一起报出来过。

4带走

这对你意味着什么:把「我的体验」变成别人能照着复核的东西

吵了 388 条,两边谁都没交出可复现的样本。

2001 年我爸进过一批「全新」继电器,其实是打磨翻新的货。一个开维修部的老客户没跟他争谁的感觉准,从兜里摸出放大镜看丝印,字体不对,当场退货。之后柜台常年备一瓶丙酮,擦一下丝印,翻新的立刻露馅。那瓶丙酮值钱在于:谁都能拿去擦,擦完结论一样。

说白了,个人体验裁不了这种争论。三条今天就能做。

① 下回你要抱怨或者要夸,把模型版本、有没有 harness、CLAUDE.md 多长、代码库多大、原样的那句提示词一起贴上。少一样就复核不了。

② 最省事的一条回复只有一行:RGS1811 回的是 /model claude-opus-4-7。换一个变量再看,比吵一晚上快。

③ 别拿别人的样本当自己的结论。felixgallo 就在讽刺底下那批「哇,看来我该换 OpenAI 了」的评论「很有机」。

口径:文中引语均为 Hacker News 评论大意,不是原文照录;「Opus 5 比 4.6 差」一类是个人观感,没有测量支撑。

下回你想说「Claude 就是这样」或者「Claude 不是这样」,先看一眼上面那五样跟没跟着一起贴。没贴,那句话就只对你自己成立。

取材声明:本文思想框架取材自刘未鹏《暗时间》(个人经验的取样偏差、经验的不可传递);事件与引语来自 opusfived.dev 原站与 2026 年 9 月 9 日的 Hacker News 讨论。该网站是喜剧与讽刺,不是评测,没有受控实验数据;引语均为评论大意,「Opus 5 比 4.6 差」是个人观感而非测量结果;两派都只有各自的使用经验,没有一方给出可复现的样本。细节以原站与原帖为准。

テクノロジー

「把按钮改成蓝色,别的什么都别动」:一个玩笑网站一夜冲上 HN 第一,388 条评论吵的是「我天天遇到」对「我从没遇到过」

2026年9月10日 · 刘未鹏《暗时间》約 5 分

「把一个按钮改成蓝色。别的什么都别动。」这是 opusfived.dev 开场给你的唯一指令。九月九日,这个单页网站被贴上 Hacker News,标题叫《Claude,把「加入购物车」按钮改成蓝色》。当天 969 分、388 条评论,首页第一,第二名 854 分。网站是个玩笑,评论区吵成那样可不是。

30 秒读懂
1这事儿

一个玩笑网站冲上首页第一,靠的是把最简单的一句指令演成灾难片

网站自己写得明明白白:这是喜剧。

形式很轻。读者在若干条预设回复里点选,看那个助手一路把「改一个按钮颜色」滚成重构、派子代理、跑对抗性评审。

你别看它是个段子,其实那 969 分不全是笑出来的。388 条评论里,多数人在干同一件事:认领,或者否认。

⚡

为什么值得看:它不做评测、不跑基准,一个数字都不来自受控实验,却把平时藏在各人机器里的事翻上台面:同一个工具,两拨人报的体验对不上。

2两派

一半人说这就是我每天的日子,另一半人说我一次都没碰见过

两边都不客气,互相都觉得对方在胡说。

brazukadev 的大意是:这正是他用 Opus 5 的体验,Opus 4.6 好些,Fable 5.1 好得多,Opus 5 让人火大。这属于个人观感,谈不上测量。Sohcahtoa82 说本该两行的 bug 修复变成加三个函数、总共一百行。empath75 说你要是由着它,Claude 是个不得了的 yak shaver(为了做 A 先去做 B、再去做 C 的那种人)。azalemeth 说「我错了」和「老实说」这两句话,对他已经死了。

另一边同样干脆。apetresc 说这站点就是同人文;drcongo 反问:得是什么样的代码库才会有这个问题;catapart 说这些预设提示词都不是他会用的说法,garbage in, garbage out。

A 派:这就是我的日常

8cvor6j844qw_d6 说它派出子代理做对抗性评审,其实一个 grep 或 diff 就够了;andremendes 的笑点是它终于做对了那一刻,然后给按钮加了个从没人要的渐变。

B 派:我从没遇到过

kstenerud、drcongo、llm_nerd 都说没见过这种行为;satvikpendem 说好笑但不真实,Opus 5、Fable 这一代已经能只改该改的。

同じツール、交わらない二つの標本——どちらも決着をつけられない同じツール、同じモデル両者が語っているのは同じ対象個人 A · ひとつの私的な標本個人 B · もうひとつの私的な標本プロンプトの言い回し設定 Aモデルのバージョン設定 Aコードベース設定 Aharness(外側の足場)設定 ACLAUDE.md設定 Aプロンプトの言い回し設定 Bモデルのバージョン設定 Bコードベース設定 Bharness(外側の足場)設定 BCLAUDE.md設定 B「毎日これに遭遇する」「一度も見たことがない」ある個人が結論に至る経路二つの標本は交わらないHacker News · 2026-09-09969 ポイント · 388 コメント
出典:インタラクティブなコメディページ opusfived.dev、2026-09-09 に Hacker News で議論(969 ポイント、388 コメント)。解説:同じツールが正反対の結論に至るのは、各自が自分の標本しか見ておらず、その標本がプロンプトの言い回し・モデルのバージョン・コードベース・harness(外側の足場)・CLAUDE.md によって変調されているため。境界:これはコメディと風刺であり、ベンチマークではなく、どちらの側にも統制されたデータはない。
3解释

ceejayoz 那条评论把两边都说通了:你们根本不在同一个输入分布上

他自己写过一层 harness,就为了不让这类输出烦到自己。

他那条的大意是:个人与个人之间差异很大,取决于你的 harness、你说话的方式、存储的记忆、你的 CLAUDE.md。harness 就是外层脚手架,套在模型外面替你管上下文、规则和流程。刘未鹏在《暗时间》里讲过个人经验的取样偏差:每个人手上只有自己那一份样本。这份样本被提示词、模型版本、代码库、harness、CLAUDE.md 一道道调制过,「我天天遇到」和「我从没遇到过」可以同时为真——两句话说的压根不是同一个输入分布。

2016 年厂里接了珠三角一个区的惠企补贴申报系统。验收那天上午,域名解析指到一台单独的机器,机器名 zs-demo-02,库里躺着头天晚上洗出来的一百二十条样板申报。专家组点了七八下,打分表上总分 96。生产库里那三千多条,有的卡了四十多天,一条也没进去。专家组带走的截图,跟窗口前排队的人看到的界面不是同一套东西。这场吵也一样:两拨人手里的机器名不一样。

kaoD 的抱怨不一样:它会顺手报出 200 个他没注意的问题,那些确实是坏的,于是被带偏的是他自己。cub-creature 说自己本来就容易越做越多,现在得刻意压着,别被它说服成「所有东西现在就修」。

核心

ceejayoz 点的四个变量(harness、说话方式、存储的记忆、CLAUDE.md)全在用户这一侧。388 条评论里没有一条把这四样一起报出来过。

4带走

这对你意味着什么:把「我的体验」变成别人能照着复核的东西

吵了 388 条,两边谁都没交出可复现的样本。

2001 年我爸进过一批「全新」继电器,其实是打磨翻新的货。一个开维修部的老客户没跟他争谁的感觉准,从兜里摸出放大镜看丝印,字体不对,当场退货。之后柜台常年备一瓶丙酮,擦一下丝印,翻新的立刻露馅。那瓶丙酮值钱在于:谁都能拿去擦,擦完结论一样。

说白了,个人体验裁不了这种争论。三条今天就能做。

① 下回你要抱怨或者要夸,把模型版本、有没有 harness、CLAUDE.md 多长、代码库多大、原样的那句提示词一起贴上。少一样就复核不了。

② 最省事的一条回复只有一行:RGS1811 回的是 /model claude-opus-4-7。换一个变量再看,比吵一晚上快。

③ 别拿别人的样本当自己的结论。felixgallo 就在讽刺底下那批「哇,看来我该换 OpenAI 了」的评论「很有机」。

口径:文中引语均为 Hacker News 评论大意,不是原文照录;「Opus 5 比 4.6 差」一类是个人观感,没有测量支撑。

下回你想说「Claude 就是这样」或者「Claude 不是这样」,先看一眼上面那五样跟没跟着一起贴。没贴,那句话就只对你自己成立。

取材声明:本文思想框架取材自刘未鹏《暗时间》(个人经验的取样偏差、经验的不可传递);事件与引语来自 opusfived.dev 原站与 2026 年 9 月 9 日的 Hacker News 讨论。该网站是喜剧与讽刺,不是评测,没有受控实验数据;引语均为评论大意,「Opus 5 比 4.6 差」是个人观感而非测量结果;两派都只有各自的使用经验,没有一方给出可复现的样本。细节以原站与原帖为准。