vlog
← 返回全部文章

Psychology

引用超 2,100 次的截止日期名研究,四面红旗指向 24 年前的数据是编的

2026-09-02 · 基思·斯坦诺维奇《对伪心理学说不》~1 min read

不进实验室,不重跑一次实验,你有办法判断一份 24 年前的数据是不是编出来的吗?2026 年 8 月 31 日,学术打假博客 Data Colada 交出了一份实打实的答卷:行为经济学名人丹·艾瑞里(畅销书《怪诞行为学》作者)与克劳斯·韦滕布罗赫 2002 年发表在《心理科学》上的著名研究「拖延、截止日期与表现」,其中 Study 2 的数据「被严重篡改或伪造」。这项研究被大量课程列为必读,Google Scholar 引用超过 2,100 次。指认它的没有内部举报人,全部证据都来自数据本身。

30 秒读懂
1导火索

一篇失败的复现,把 24 年前的原始数据拖回了解剖台

事情的顺序值得记清楚:先有复现失败,后有数据重析。

原研究讲的故事很动人:拖延是人性,但只要把任务拆开、每个任务配一个外部强加的截止日期,人的表现就会好于自己随意设定截止、或把所有东西拖到最后一天交的人。这个结论进了无数门课的必读清单。2026 年,《心理科学》刊出 Kyle Hyndman 与 Alberto Bisin 对 Study 2 的复现研究,结果没能复现。复现者并非冲着打假来的,他们只是照原方案把实验重做了一遍;打假是原始数据重析之后才有的事。主持 Data Colada 的三位学者 Uri Simonsohn、Joe Simmons 与 Leif Nelson 于是把 2002 年的原始数据全面重析,越查疑点越多。程序上他们也没有抄近道:2026 年 7 月 20 日,发表前六周,草稿已送到原作者两人、复现作者与《心理科学》主编 Simine Vazire 手里。

⚡

为什么复现失败会升级成查数据?复现失败本身很常见,样本不同、年代不同、执行细节不同,都可能让效应缩水。可一旦原研究的效应大到反常,最该先排除的解释就从「时代变了」换成了「数据本身有没有问题」。

2红旗一

每组只有 20 个人,效应却大得像教科书里画出来的

第一面红旗不需要什么高深统计,只需要常识。

Study 2 每组只有 20 名被试,三个因变量却全部呈现完美的同向模式。校对纠错数上,组间差距折算成效应量是 Cohen's d=2.5,实验条件与纠错数的相关达到 r=.7。d=2.5 是什么概念?两组的分布几乎不重叠:从「外部截止」组随便拉一个人出来,成绩大概率压过对照组的绝大多数人。一个安排交稿时间的小干预,做出了这种成绩。真实的行为实验里,几乎见不到这样的数字。

核心

真实的人自带噪声。20 人的小样本跑出三个完美同向、d=2.5 的结果,比起「截止日期真有这么神」,「数字被人动过」是更值得先查的解释。

3红旗二·三

总分撞车可以是巧合,逐题全同不行;该相关的地方全线失联

第二、第三面红旗要凑近了看:一处多出来的重复,一处消失了的相关。

先看重复。多名被试在三个校对任务里的纠错数逐题完全相同。注意,是每道题都相同,而非总数碰巧一样。打个比方:两个学生总分都是 85 并不稀奇,三张卷子每一道题的得分都一模一样,监考老师就该起身走过去了。

再看消失的相关。三个校对任务几乎一样,一个人第一个做得好,第二个理应不差;五个主观评价项(喜欢、有趣等 0 到 100 分打分)之间也该彼此呼应;自报耗时同理。复现数据全部如此,原始数据全线失联:

体检项复现数据原始数据
五个主观评价项两两相关+.63 ~ +.92−.29 ~ +.18,无一显著为正
三个校对任务成绩两两相关+.74 以上+.03 ~ +.27
自报耗时两两相关+.79 ~ +.95+.05 ~ +.17

这三行本来只是检查「数据正不正常」的体检项,谁也没打算靠它证明什么。偏偏体检指标最难伪装:编造者盯着的是各组均值要拉开差距,很少有人记得,真实的人会在所有题目上留下一致的自己。复现团队与原始研究测的是同一批任务、同一套问卷,这几项体检却给出了两种截然不同的读数。

4红旗四

人会说「大概 30 分钟」,机器不会:整数比例只有 11.7%

第四面红旗最直白,你现在就能拿自己验证。

有人问你昨晚校对花了多久,你会说 20 分钟、半小时,几乎不会有人回答「23 分钟」。估算时间报整数是人类的通病,也因此成了鉴别数据来源的指纹。复现数据里,85% 的自报分钟数是整数;原始数据里只有 11.7%,和纯随机落在整数上的期望值 10% 几乎一样。这份数据不像人嘴里报出来的,倒像从均匀分布里抽出来的。程序批量生成数字很容易,给数字补上人味,反而是造假里最容易漏掉的工序。

复现数据:自报分钟为整数
85%
原始数据:自报分钟为整数
11.7%
纯随机落在整数的期望
10%

三个数字出自 Data Colada #138 对两份数据的同口径统计;「整数」的具体口径以原文为准。

四面红旗单独看,每一面或许都还能找补两句;落在同一份数据上,Data Colada 的结论是:无法为全部异常找到善意的解释,判定 Study 2 的数据被严重篡改或伪造,下一篇将分析 Study 1。

FAKERS FAKE THE MEANS, BUT FORGET THE CORRELATIONS FLAG 1 · EFFECT SIZE d=2.5 · r=.7 · absurdly large healthy: far smaller in real studies FLAG 2 · REPEATED ROWS item-by-item scores repeat exactly healthy: totals tie, items differ FLAG 3 · CORRELATIONS twin tasks correlate only +.03~+.27 healthy: replication +.74 and up FLAG 4 · ROUND NUMBERS minutes reported: only 11.7% round healthy: people round ~85% of the time Study 2 raw data n=20 per cell · published 2002 ALL FOUR CHECKS FLASH RED no benign explanation found
Source: Data Colada #138 (2026-08-31), a re-analysis of the 2002 Ariely & Wertenbroch study in Psychological Science, prompted by a failed replication published in the same journal. Fakers can fabricate the group means they want, but real people leave a consistent correlation structure behind; that is where the data gave itself away. Statistical evidence, not a legal verdict.
5机制

科学的自我纠错,靠的从来不是谁的人品

这正是基思·斯坦诺维奇在《对伪心理学说不》里反复敲打的那件事。

科学不请你信任何人。它只要求三样东西:主张可检验、数据可公开、他人可重析。艾瑞里此前已因 2012 年保险诚实签名研究的数据造假指控(Data Colada 2021 年揭露)广受质疑,这一次的不同在于,指控不依赖任何知情人,24 年前的公开数据自己交代了问题。

金句

造假者能编出想要的均值,却常常忘了编相关结构。相关结构是数据的质地,最难伪装。

斯坦诺维奇书里的另一条也应验了:单项研究永远只是概率证据,「效应完美得像教科书」本身就是警报。可在 2,100 次引用里,有多少人把它当成了定论?

6带走

这对你意味着什么:倒掉的是一份数据,截止日期还站着

先把该说清的边界说清,再谈怎么用。

三条边界:本文与 Data Colada #138 针对的都是 Study 2 的数据,作者方尚未公开回应这篇分析;「被篡改或伪造」是基于统计证据的学术判断,不是法庭判决;「截止日期帮助自控」这个大方向另有其他研究支撑,这次出问题的只是这一份数据。

还有一句必须向你坦白:涉事作者的《怪诞行为学》同样是本站的取材书目之一,过往文章引用过他的框架。正因为有这层关系,这条消息更应该由我们自己讲清楚。

落到你手上的东西也很实在。下次看到「研究表明」,你未必有本事重析原始数据,但你可以问三个问题:数据公开了吗?效应是不是好得不像话?有人复现过吗?三问里有两问答不上来,就先把那条结论放进「等等再信」的那一栏。这三个问题挡不住所有造假,但至少能把「教科书级的完美」从加分项拨回警报项。

那些引用了它 2,100 次的论文,那些把它写进大纲的课程,接下来会一条一条改过来吗?还是照旧流传下去,仿佛什么都没发生?

本文取材自基思·斯坦诺维奇《对伪心理学说不》;据 Data Colada 2026-08-31 分析文章与《心理科学》复现研究。科普解读非学术仲裁,以原文与期刊后续处理为准。

心理

引用超 2,100 次的截止日期名研究,四面红旗指向 24 年前的数据是编的

2026-09-02 · 基思·斯坦诺维奇《对伪心理学说不》约 6 分钟

不进实验室,不重跑一次实验,你有办法判断一份 24 年前的数据是不是编出来的吗?2026 年 8 月 31 日,学术打假博客 Data Colada 交出了一份实打实的答卷:行为经济学名人丹·艾瑞里(畅销书《怪诞行为学》作者)与克劳斯·韦滕布罗赫 2002 年发表在《心理科学》上的著名研究「拖延、截止日期与表现」,其中 Study 2 的数据「被严重篡改或伪造」。这项研究被大量课程列为必读,Google Scholar 引用超过 2,100 次。指认它的没有内部举报人,全部证据都来自数据本身。

30 秒读懂
1导火索

一篇失败的复现,把 24 年前的原始数据拖回了解剖台

事情的顺序值得记清楚:先有复现失败,后有数据重析。

原研究讲的故事很动人:拖延是人性,但只要把任务拆开、每个任务配一个外部强加的截止日期,人的表现就会好于自己随意设定截止、或把所有东西拖到最后一天交的人。这个结论进了无数门课的必读清单。2026 年,《心理科学》刊出 Kyle Hyndman 与 Alberto Bisin 对 Study 2 的复现研究,结果没能复现。复现者并非冲着打假来的,他们只是照原方案把实验重做了一遍;打假是原始数据重析之后才有的事。主持 Data Colada 的三位学者 Uri Simonsohn、Joe Simmons 与 Leif Nelson 于是把 2002 年的原始数据全面重析,越查疑点越多。程序上他们也没有抄近道:2026 年 7 月 20 日,发表前六周,草稿已送到原作者两人、复现作者与《心理科学》主编 Simine Vazire 手里。

⚡

为什么复现失败会升级成查数据?复现失败本身很常见,样本不同、年代不同、执行细节不同,都可能让效应缩水。可一旦原研究的效应大到反常,最该先排除的解释就从「时代变了」换成了「数据本身有没有问题」。

2红旗一

每组只有 20 个人,效应却大得像教科书里画出来的

第一面红旗不需要什么高深统计,只需要常识。

Study 2 每组只有 20 名被试,三个因变量却全部呈现完美的同向模式。校对纠错数上,组间差距折算成效应量是 Cohen's d=2.5,实验条件与纠错数的相关达到 r=.7。d=2.5 是什么概念?两组的分布几乎不重叠:从「外部截止」组随便拉一个人出来,成绩大概率压过对照组的绝大多数人。一个安排交稿时间的小干预,做出了这种成绩。真实的行为实验里,几乎见不到这样的数字。

核心

真实的人自带噪声。20 人的小样本跑出三个完美同向、d=2.5 的结果,比起「截止日期真有这么神」,「数字被人动过」是更值得先查的解释。

3红旗二·三

总分撞车可以是巧合,逐题全同不行;该相关的地方全线失联

第二、第三面红旗要凑近了看:一处多出来的重复,一处消失了的相关。

先看重复。多名被试在三个校对任务里的纠错数逐题完全相同。注意,是每道题都相同,而非总数碰巧一样。打个比方:两个学生总分都是 85 并不稀奇,三张卷子每一道题的得分都一模一样,监考老师就该起身走过去了。

再看消失的相关。三个校对任务几乎一样,一个人第一个做得好,第二个理应不差;五个主观评价项(喜欢、有趣等 0 到 100 分打分)之间也该彼此呼应;自报耗时同理。复现数据全部如此,原始数据全线失联:

体检项复现数据原始数据
五个主观评价项两两相关+.63 ~ +.92−.29 ~ +.18,无一显著为正
三个校对任务成绩两两相关+.74 以上+.03 ~ +.27
自报耗时两两相关+.79 ~ +.95+.05 ~ +.17

这三行本来只是检查「数据正不正常」的体检项,谁也没打算靠它证明什么。偏偏体检指标最难伪装:编造者盯着的是各组均值要拉开差距,很少有人记得,真实的人会在所有题目上留下一致的自己。复现团队与原始研究测的是同一批任务、同一套问卷,这几项体检却给出了两种截然不同的读数。

4红旗四

人会说「大概 30 分钟」,机器不会:整数比例只有 11.7%

第四面红旗最直白,你现在就能拿自己验证。

有人问你昨晚校对花了多久,你会说 20 分钟、半小时,几乎不会有人回答「23 分钟」。估算时间报整数是人类的通病,也因此成了鉴别数据来源的指纹。复现数据里,85% 的自报分钟数是整数;原始数据里只有 11.7%,和纯随机落在整数上的期望值 10% 几乎一样。这份数据不像人嘴里报出来的,倒像从均匀分布里抽出来的。程序批量生成数字很容易,给数字补上人味,反而是造假里最容易漏掉的工序。

复现数据:自报分钟为整数
85%
原始数据:自报分钟为整数
11.7%
纯随机落在整数的期望
10%

三个数字出自 Data Colada #138 对两份数据的同口径统计;「整数」的具体口径以原文为准。

四面红旗单独看,每一面或许都还能找补两句;落在同一份数据上,Data Colada 的结论是:无法为全部异常找到善意的解释,判定 Study 2 的数据被严重篡改或伪造,下一篇将分析 Study 1。

造假者编得出均值,编不出相关结构 红旗一 · 效应尺寸 d=2.5,r=.7,大得离谱 健康值:真实实验里几乎见不到 红旗二 · 重复观测 多名被试逐题纠错数全同 健康值:总分偶同,逐题必异 红旗三 · 相关结构 同类任务相关仅 +.03~+.27 健康值:复现数据 +.74 以上 红旗四 · 整数化习惯 自报分钟仅 11.7% 为整数 健康值:人报时间约 85% 是整数 Study 2 原始数据 每组仅 20 人 · 2002 年发表 四项体检全部亮红 找不到善意的解释
来源:Data Colada #138(2026-08-31)对艾瑞里与韦滕布罗赫 2002 年《心理科学》研究的重析,导火索是同刊发表的复现失败。造假者能编出想要的组间均值,真实的人却会留下一致的相关结构,数据正是在这里露了馅。统计证据,非法律结论。
5机制

科学的自我纠错,靠的从来不是谁的人品

这正是基思·斯坦诺维奇在《对伪心理学说不》里反复敲打的那件事。

科学不请你信任何人。它只要求三样东西:主张可检验、数据可公开、他人可重析。艾瑞里此前已因 2012 年保险诚实签名研究的数据造假指控(Data Colada 2021 年揭露)广受质疑,这一次的不同在于,指控不依赖任何知情人,24 年前的公开数据自己交代了问题。

金句

造假者能编出想要的均值,却常常忘了编相关结构。相关结构是数据的质地,最难伪装。

斯坦诺维奇书里的另一条也应验了:单项研究永远只是概率证据,「效应完美得像教科书」本身就是警报。可在 2,100 次引用里,有多少人把它当成了定论?

6带走

这对你意味着什么:倒掉的是一份数据,截止日期还站着

先把该说清的边界说清,再谈怎么用。

三条边界:本文与 Data Colada #138 针对的都是 Study 2 的数据,作者方尚未公开回应这篇分析;「被篡改或伪造」是基于统计证据的学术判断,不是法庭判决;「截止日期帮助自控」这个大方向另有其他研究支撑,这次出问题的只是这一份数据。

还有一句必须向你坦白:涉事作者的《怪诞行为学》同样是本站的取材书目之一,过往文章引用过他的框架。正因为有这层关系,这条消息更应该由我们自己讲清楚。

落到你手上的东西也很实在。下次看到「研究表明」,你未必有本事重析原始数据,但你可以问三个问题:数据公开了吗?效应是不是好得不像话?有人复现过吗?三问里有两问答不上来,就先把那条结论放进「等等再信」的那一栏。这三个问题挡不住所有造假,但至少能把「教科书级的完美」从加分项拨回警报项。

那些引用了它 2,100 次的论文,那些把它写进大纲的课程,接下来会一条一条改过来吗?还是照旧流传下去,仿佛什么都没发生?

本文取材自基思·斯坦诺维奇《对伪心理学说不》;据 Data Colada 2026-08-31 分析文章与《心理科学》复现研究。科普解读非学术仲裁,以原文与期刊后续处理为准。

心理学

引用超 2,100 次的截止日期名研究,四面红旗指向 24 年前的数据是编的

2026-09-02 · 基思·斯坦诺维奇《对伪心理学说不》約 6 分

不进实验室,不重跑一次实验,你有办法判断一份 24 年前的数据是不是编出来的吗?2026 年 8 月 31 日,学术打假博客 Data Colada 交出了一份实打实的答卷:行为经济学名人丹·艾瑞里(畅销书《怪诞行为学》作者)与克劳斯·韦滕布罗赫 2002 年发表在《心理科学》上的著名研究「拖延、截止日期与表现」,其中 Study 2 的数据「被严重篡改或伪造」。这项研究被大量课程列为必读,Google Scholar 引用超过 2,100 次。指认它的没有内部举报人,全部证据都来自数据本身。

30 秒读懂
1导火索

一篇失败的复现,把 24 年前的原始数据拖回了解剖台

事情的顺序值得记清楚:先有复现失败,后有数据重析。

原研究讲的故事很动人:拖延是人性,但只要把任务拆开、每个任务配一个外部强加的截止日期,人的表现就会好于自己随意设定截止、或把所有东西拖到最后一天交的人。这个结论进了无数门课的必读清单。2026 年,《心理科学》刊出 Kyle Hyndman 与 Alberto Bisin 对 Study 2 的复现研究,结果没能复现。复现者并非冲着打假来的,他们只是照原方案把实验重做了一遍;打假是原始数据重析之后才有的事。主持 Data Colada 的三位学者 Uri Simonsohn、Joe Simmons 与 Leif Nelson 于是把 2002 年的原始数据全面重析,越查疑点越多。程序上他们也没有抄近道:2026 年 7 月 20 日,发表前六周,草稿已送到原作者两人、复现作者与《心理科学》主编 Simine Vazire 手里。

⚡

为什么复现失败会升级成查数据?复现失败本身很常见,样本不同、年代不同、执行细节不同,都可能让效应缩水。可一旦原研究的效应大到反常,最该先排除的解释就从「时代变了」换成了「数据本身有没有问题」。

2红旗一

每组只有 20 个人,效应却大得像教科书里画出来的

第一面红旗不需要什么高深统计,只需要常识。

Study 2 每组只有 20 名被试,三个因变量却全部呈现完美的同向模式。校对纠错数上,组间差距折算成效应量是 Cohen's d=2.5,实验条件与纠错数的相关达到 r=.7。d=2.5 是什么概念?两组的分布几乎不重叠:从「外部截止」组随便拉一个人出来,成绩大概率压过对照组的绝大多数人。一个安排交稿时间的小干预,做出了这种成绩。真实的行为实验里,几乎见不到这样的数字。

核心

真实的人自带噪声。20 人的小样本跑出三个完美同向、d=2.5 的结果,比起「截止日期真有这么神」,「数字被人动过」是更值得先查的解释。

3红旗二·三

总分撞车可以是巧合,逐题全同不行;该相关的地方全线失联

第二、第三面红旗要凑近了看:一处多出来的重复,一处消失了的相关。

先看重复。多名被试在三个校对任务里的纠错数逐题完全相同。注意,是每道题都相同,而非总数碰巧一样。打个比方:两个学生总分都是 85 并不稀奇,三张卷子每一道题的得分都一模一样,监考老师就该起身走过去了。

再看消失的相关。三个校对任务几乎一样,一个人第一个做得好,第二个理应不差;五个主观评价项(喜欢、有趣等 0 到 100 分打分)之间也该彼此呼应;自报耗时同理。复现数据全部如此,原始数据全线失联:

体检项复现数据原始数据
五个主观评价项两两相关+.63 ~ +.92−.29 ~ +.18,无一显著为正
三个校对任务成绩两两相关+.74 以上+.03 ~ +.27
自报耗时两两相关+.79 ~ +.95+.05 ~ +.17

这三行本来只是检查「数据正不正常」的体检项,谁也没打算靠它证明什么。偏偏体检指标最难伪装:编造者盯着的是各组均值要拉开差距,很少有人记得,真实的人会在所有题目上留下一致的自己。复现团队与原始研究测的是同一批任务、同一套问卷,这几项体检却给出了两种截然不同的读数。

4红旗四

人会说「大概 30 分钟」,机器不会:整数比例只有 11.7%

第四面红旗最直白,你现在就能拿自己验证。

有人问你昨晚校对花了多久,你会说 20 分钟、半小时,几乎不会有人回答「23 分钟」。估算时间报整数是人类的通病,也因此成了鉴别数据来源的指纹。复现数据里,85% 的自报分钟数是整数;原始数据里只有 11.7%,和纯随机落在整数上的期望值 10% 几乎一样。这份数据不像人嘴里报出来的,倒像从均匀分布里抽出来的。程序批量生成数字很容易,给数字补上人味,反而是造假里最容易漏掉的工序。

复现数据:自报分钟为整数
85%
原始数据:自报分钟为整数
11.7%
纯随机落在整数的期望
10%

三个数字出自 Data Colada #138 对两份数据的同口径统计;「整数」的具体口径以原文为准。

四面红旗单独看,每一面或许都还能找补两句;落在同一份数据上,Data Colada 的结论是:无法为全部异常找到善意的解释,判定 Study 2 的数据被严重篡改或伪造,下一篇将分析 Study 1。

平均は捏造できても、相関構造は作れない 危険信号1 · 効果量 d=2.5・r=.7、異常な大きさ 健全値:実際の実験ではまず見ない 危険信号2 · 重複データ 複数の参加者が全問同一の成績 健全値:合計は偶然でも各問は違う 危険信号3 · 相関構造 同型課題の相関は +.03~+.27 健全値:追試では +.74 以上 危険信号4 · 丸め癖 自己申告の分数、整数は 11.7% 健全値:人は約 85% を丸めて言う Study 2 の元データ 各群 20 人 · 2002 年発表 4 項目すべて赤信号 善意の説明が見つからない
出典:Data Colada #138(2026-08-31)による 2002 年『Psychological Science』掲載研究の再分析。きっかけは同誌に載った追試の失敗。平均は捏造できても、実在の人間は一貫した相関構造を残す。データはそこでほころびた。統計的証拠であり、法的結論ではない。
5机制

科学的自我纠错,靠的从来不是谁的人品

这正是基思·斯坦诺维奇在《对伪心理学说不》里反复敲打的那件事。

科学不请你信任何人。它只要求三样东西:主张可检验、数据可公开、他人可重析。艾瑞里此前已因 2012 年保险诚实签名研究的数据造假指控(Data Colada 2021 年揭露)广受质疑,这一次的不同在于,指控不依赖任何知情人,24 年前的公开数据自己交代了问题。

金句

造假者能编出想要的均值,却常常忘了编相关结构。相关结构是数据的质地,最难伪装。

斯坦诺维奇书里的另一条也应验了:单项研究永远只是概率证据,「效应完美得像教科书」本身就是警报。可在 2,100 次引用里,有多少人把它当成了定论?

6带走

这对你意味着什么:倒掉的是一份数据,截止日期还站着

先把该说清的边界说清,再谈怎么用。

三条边界:本文与 Data Colada #138 针对的都是 Study 2 的数据,作者方尚未公开回应这篇分析;「被篡改或伪造」是基于统计证据的学术判断,不是法庭判决;「截止日期帮助自控」这个大方向另有其他研究支撑,这次出问题的只是这一份数据。

还有一句必须向你坦白:涉事作者的《怪诞行为学》同样是本站的取材书目之一,过往文章引用过他的框架。正因为有这层关系,这条消息更应该由我们自己讲清楚。

落到你手上的东西也很实在。下次看到「研究表明」,你未必有本事重析原始数据,但你可以问三个问题:数据公开了吗?效应是不是好得不像话?有人复现过吗?三问里有两问答不上来,就先把那条结论放进「等等再信」的那一栏。这三个问题挡不住所有造假,但至少能把「教科书级的完美」从加分项拨回警报项。

那些引用了它 2,100 次的论文,那些把它写进大纲的课程,接下来会一条一条改过来吗?还是照旧流传下去,仿佛什么都没发生?

本文取材自基思·斯坦诺维奇《对伪心理学说不》;据 Data Colada 2026-08-31 分析文章与《心理科学》复现研究。科普解读非学术仲裁,以原文与期刊后续处理为准。