vlog
← 返回全部文章

心理

你用来嘲笑别人的那条曲线,有一半是排序方法自己画的

2026 年 7 月 28 日 · 基思·斯坦诺维奇《对伪心理学说不》~1 min read

小蔡把那张曲线图截给我的时候,是拿它骂自己的:「越不行的人越觉得自己行,你说我是不是就那种?」二十七八岁的姑娘,大活儿一律拖到最后一刻,交完先给自己判一句废物。那张图叫邓宁-克鲁格曲线,饭桌上一句「越无知的人越自信」,就够把一个人的一整年定性了。2026 年,两位学者把画那张图的数据重新算了一遍,发现曲线里有相当一截是画法本身造出来的,修正之后,箭头指向了反方向。

30 秒读懂
1重算

有人把那张著名的曲线拆开,重新算了一遍

动手的是两位做行为经济的学者。

论文 2026 年登在《心理学评论》上,DOI 10.1037/rev0000644。材料是一份大型复现数据集,数千名参与者,每人先做一份测验,再估一次自己考得怎么样。流程跟当年那项经典研究一模一样。

差别只在统计模型上。以往画这张图,默认考试分数约等于能力本身。这次的模型多开了两个口子:一个装考试成绩里的随机成分,一个装自我预测里的随机成分。随机成分说白了就是那天的手气,加上你随口一估时的偏差。口子一开,那条被引用二十多年的曲线塌了一大截。

为什么值得看:这条曲线大概是心理学里被转发最多的一张图。它塌掉的方式,比它本身更值得学一遍。

2陷阱

先按分数把人分组,这道工序自己就会画出一条曲线

出问题的地方不在参与者的脑子里,在他们被排进哪一格。

一场考试的分数,永远是两样东西加在一起:你真会多少,加上那天的手气。题目正好压中你翻过的那几页,蒙对三道选择题,都算。把人按分数从低到高切成四组,最低那组里必然混进一批运气差的人,真实水平比那个分数好看得多。

接着让这批人估自己考得如何。他们报出的数字其实挺贴近真实水平,并不离谱。可研究者把这个估计拿去和那个被运气压低的分数一比,落差就出来了,读起来就成了「高估自己」,曲线左端被顶高一截。de Meza 的原话是,单纯按考试成绩给参与者排序,「会在数学上扭曲数据,制造出一个并不存在的心理学现象」。

高分那头是镜像:最高一组里混着当天手气好的人,估计低于那个被运气抬高的分数,看上去就成了「谦虚」。两头一顶一压,那条收敛的曲线就画成了。它描述的更多是分组的方式,跟被分组的人关系不大。

回头说小蔡。她每次咨询提前二十分钟到,在楼下便利店站着喝完一盒常温酸奶才肯上楼。就这么个人,拿一次交得难看的活给自己排了序,对着那张图问我是不是「不知道自己不知道」的那种。我没顺着她的问法答,只问了一句:「那回的分数里,有多少是你的本事,有多少是那两周的手气?」

HALF THAT FAMOUS CURVE IS DRAWN BY THE SORTING ITSELFWHERE A TEST SCORE COMES FROMTrue abilitywhat you knowRandom lucknoise that dayTest scoreability and luck, mixedSORT PEOPLE BY SCOREthis step alone bends itsame trap as regression to the meanThe classic curvethe low scorers look most confidentpart of it is made by the sortingOnce the noise is modelledoverconfidence is widespreadhigher ability, more overconfidentThe arrow flipsabler people overrate morenoise amplified by sortingmain causal pathrandom noise
Source: Dawson & de Meza, Psychological Review 2026 (DOI 10.1037/rev0000644). Sorting participants by raw test score mathematically inflates the apparent overestimation of the low-scoring group, manufacturing an effect that is not there; once the noise is modelled, overconfidence is widespread and stronger among higher-ability people. Framework: Stanovich, How to Think Straight About Psychology. Popular-science interpretation, not professional psychological advice.
打个比方

用一杆有点晃的秤称一百袋米,把最轻的十袋挑出来换准秤复称,平均会比第一次重。不是米在长,是第一次称最轻的那几袋里,混着几次读数偏低的。拿第一次的读数当真,就能写出「轻米会自己变重」。

3同一副面孔

体检复查和邓宁-克鲁格曲线,栽在同一个坑里

按结果排序再看差异,这动作在统计里有个老名字。

均值回归。挑出体检里血压最高的一百人,什么都不干,三个月后复测,平均值会往下走一点,因为第一次量得最高的人里,总有一部分那天正好紧张。

邓宁-克鲁格曲线是这个动作的另一副面孔:先用一次带噪声的测量给人排序,再拿排序后的组去和别的东西比。均值回归的结论是「数字会往回走」,听着像统计课的例题;这一版的结论是「无能的人自信满满」,听着像人性洞察。同一个陷阱,后一种说法更像在讲人,所以传得远得多。

旧读法

低分组高估自己,说明他们缺乏元认知能力。

新读法

低分组里混着运气差的人,那点落差有一部分是分组方式送的。

4反转

模型修好之后,箭头掉了个头

曲线塌掉只是第一步,接下来那个结果更难消化。

把两处随机成分都建模进去,剩下的图景:过度自信普遍存在,而且能力更高的人往往更过度自信。Dawson 的说法是,那个「无能者自信满满」的流行形象,「告诉我们的与其说是人类心理,不如说是统计分析里藏着的陷阱」。

研究者没有把话说死。他们留了余地:低能力者有时确实可能缺乏元认知能力,也就是不知道自己不知道。但在他们的解读里,过度自信更像一种信号激励在起作用,即向别人显示自己行,这一点在高能力人群里尤其明显。

它把过度自信从「认知缺陷」挪到了「对外表态」。一个人说自己有八成把握,可能真信八成,也可能他清楚只有说到八成才有人把活交给他。两种情形在数据里长得一样。这话我听着也不舒服:我写「大概是这样」的时候,那份笃定有几分是证据给的,几分是怕你划走,我也分不清。

那这条曲线,以后还能怎么用

斯坦诺维奇那本书的用处,正好落在这种时候。

《对伪心理学说不》反复讲一件事:判断一个心理学主张,先看证据是怎么来的。样本怎么选,组怎么分,相关有没有被当成因果。这条曲线过去二十多年贴在无数张幻灯片上,顺手到几乎能套住任何一个你看不惯的人。这份顺手本身就是提醒:概念的流行度和支撑它的证据强度,中间没有必然联系。

下次再遇到按「最差的一组」「最好的一组」讲故事的研究,先问两句:这组人是按什么排进来的?那个指标里有多少随机成分?

2023 年春天,我做完最后一个咨询赶十号线末班车,把一种很多人都有的困境匿名写成长文发了出去。凌晨两点多,留言里反复出现同一句:「原来不只我一个人这样。」这篇论文修正之后剩下的那半截,说的是同一件事的冷版本:你自己大概率也在那张图上,而且要是你真比多数人强,落点可能还更偏一点。

至于身边那位「懂得不多但特别自信」的同事,这项研究没说他不存在,只是说你手里那张图证不了他。你哪天又想拿这条曲线给谁定性,能不能先在心里问一句:这个判断,是他那天的表现给你的,还是那一次排序替你下的?

口径说明:单项重新分析不等于领域定论,后续复现仍可能修正结论。本文为科普解读,非专业心理建议。

本文框架取材自基思·斯坦诺维奇《对伪心理学说不》(Keith Stanovich, How to Think Straight About Psychology)中关于证据等级、相关与因果、概念流行度不等于证据强度的论述。研究出处:Chris Dawson & David de Meza, Psychological Review, 2026, DOI 10.1037/rev0000644;引述据 phys.org 2026 年 7 月报道。本文为科普解读,非专业心理建议。

心理

你用来嘲笑别人的那条曲线,有一半是排序方法自己画的

2026 年 7 月 28 日 · 基思·斯坦诺维奇《对伪心理学说不》约 6 分钟

小蔡把那张曲线图截给我的时候,是拿它骂自己的:「越不行的人越觉得自己行,你说我是不是就那种?」二十七八岁的姑娘,大活儿一律拖到最后一刻,交完先给自己判一句废物。那张图叫邓宁-克鲁格曲线,饭桌上一句「越无知的人越自信」,就够把一个人的一整年定性了。2026 年,两位学者把画那张图的数据重新算了一遍,发现曲线里有相当一截是画法本身造出来的,修正之后,箭头指向了反方向。

30 秒读懂
1重算

有人把那张著名的曲线拆开,重新算了一遍

动手的是两位做行为经济的学者。

论文 2026 年登在《心理学评论》上,DOI 10.1037/rev0000644。材料是一份大型复现数据集,数千名参与者,每人先做一份测验,再估一次自己考得怎么样。流程跟当年那项经典研究一模一样。

差别只在统计模型上。以往画这张图,默认考试分数约等于能力本身。这次的模型多开了两个口子:一个装考试成绩里的随机成分,一个装自我预测里的随机成分。随机成分说白了就是那天的手气,加上你随口一估时的偏差。口子一开,那条被引用二十多年的曲线塌了一大截。

为什么值得看:这条曲线大概是心理学里被转发最多的一张图。它塌掉的方式,比它本身更值得学一遍。

2陷阱

先按分数把人分组,这道工序自己就会画出一条曲线

出问题的地方不在参与者的脑子里,在他们被排进哪一格。

一场考试的分数,永远是两样东西加在一起:你真会多少,加上那天的手气。题目正好压中你翻过的那几页,蒙对三道选择题,都算。把人按分数从低到高切成四组,最低那组里必然混进一批运气差的人,真实水平比那个分数好看得多。

接着让这批人估自己考得如何。他们报出的数字其实挺贴近真实水平,并不离谱。可研究者把这个估计拿去和那个被运气压低的分数一比,落差就出来了,读起来就成了「高估自己」,曲线左端被顶高一截。de Meza 的原话是,单纯按考试成绩给参与者排序,「会在数学上扭曲数据,制造出一个并不存在的心理学现象」。

高分那头是镜像:最高一组里混着当天手气好的人,估计低于那个被运气抬高的分数,看上去就成了「谦虚」。两头一顶一压,那条收敛的曲线就画成了。它描述的更多是分组的方式,跟被分组的人关系不大。

回头说小蔡。她每次咨询提前二十分钟到,在楼下便利店站着喝完一盒常温酸奶才肯上楼。就这么个人,拿一次交得难看的活给自己排了序,对着那张图问我是不是「不知道自己不知道」的那种。我没顺着她的问法答,只问了一句:「那回的分数里,有多少是你的本事,有多少是那两周的手气?」

那条曲线有一半是排序方法自己画的分数是怎么来的 / INPUT真实能力你真会多少随机运气那天的手气考试分数实力和运气混在一起按分数把人分组光这一步就会造出效应和均值回归是同一个陷阱经典的那条曲线低分的人显得最自信其中一截是排序造出来的把随机成分建模之后过度自信普遍存在能力更高的人反而更过度自信箭头掉了个头越有本事越容易高估自己噪声被排序放大主因果随机噪声
来源:Dawson & de Meza,《心理学评论》2026,DOI 10.1037/rev0000644。按考试分数给人分组,会在数学上放大低分组的「高估」,制造出并不存在的效应;把随机成分建模后,过度自信普遍存在且能力更高者更甚。框架:斯坦诺维奇《对伪心理学说不》。科普解读,非专业心理建议。
打个比方

用一杆有点晃的秤称一百袋米,把最轻的十袋挑出来换准秤复称,平均会比第一次重。不是米在长,是第一次称最轻的那几袋里,混着几次读数偏低的。拿第一次的读数当真,就能写出「轻米会自己变重」。

3同一副面孔

体检复查和邓宁-克鲁格曲线,栽在同一个坑里

按结果排序再看差异,这动作在统计里有个老名字。

均值回归。挑出体检里血压最高的一百人,什么都不干,三个月后复测,平均值会往下走一点,因为第一次量得最高的人里,总有一部分那天正好紧张。

邓宁-克鲁格曲线是这个动作的另一副面孔:先用一次带噪声的测量给人排序,再拿排序后的组去和别的东西比。均值回归的结论是「数字会往回走」,听着像统计课的例题;这一版的结论是「无能的人自信满满」,听着像人性洞察。同一个陷阱,后一种说法更像在讲人,所以传得远得多。

旧读法

低分组高估自己,说明他们缺乏元认知能力。

新读法

低分组里混着运气差的人,那点落差有一部分是分组方式送的。

4反转

模型修好之后,箭头掉了个头

曲线塌掉只是第一步,接下来那个结果更难消化。

把两处随机成分都建模进去,剩下的图景:过度自信普遍存在,而且能力更高的人往往更过度自信。Dawson 的说法是,那个「无能者自信满满」的流行形象,「告诉我们的与其说是人类心理,不如说是统计分析里藏着的陷阱」。

研究者没有把话说死。他们留了余地:低能力者有时确实可能缺乏元认知能力,也就是不知道自己不知道。但在他们的解读里,过度自信更像一种信号激励在起作用,即向别人显示自己行,这一点在高能力人群里尤其明显。

它把过度自信从「认知缺陷」挪到了「对外表态」。一个人说自己有八成把握,可能真信八成,也可能他清楚只有说到八成才有人把活交给他。两种情形在数据里长得一样。这话我听着也不舒服:我写「大概是这样」的时候,那份笃定有几分是证据给的,几分是怕你划走,我也分不清。

那这条曲线,以后还能怎么用

斯坦诺维奇那本书的用处,正好落在这种时候。

《对伪心理学说不》反复讲一件事:判断一个心理学主张,先看证据是怎么来的。样本怎么选,组怎么分,相关有没有被当成因果。这条曲线过去二十多年贴在无数张幻灯片上,顺手到几乎能套住任何一个你看不惯的人。这份顺手本身就是提醒:概念的流行度和支撑它的证据强度,中间没有必然联系。

下次再遇到按「最差的一组」「最好的一组」讲故事的研究,先问两句:这组人是按什么排进来的?那个指标里有多少随机成分?

2023 年春天,我做完最后一个咨询赶十号线末班车,把一种很多人都有的困境匿名写成长文发了出去。凌晨两点多,留言里反复出现同一句:「原来不只我一个人这样。」这篇论文修正之后剩下的那半截,说的是同一件事的冷版本:你自己大概率也在那张图上,而且要是你真比多数人强,落点可能还更偏一点。

至于身边那位「懂得不多但特别自信」的同事,这项研究没说他不存在,只是说你手里那张图证不了他。你哪天又想拿这条曲线给谁定性,能不能先在心里问一句:这个判断,是他那天的表现给你的,还是那一次排序替你下的?

口径说明:单项重新分析不等于领域定论,后续复现仍可能修正结论。本文为科普解读,非专业心理建议。

本文框架取材自基思·斯坦诺维奇《对伪心理学说不》(Keith Stanovich, How to Think Straight About Psychology)中关于证据等级、相关与因果、概念流行度不等于证据强度的论述。研究出处:Chris Dawson & David de Meza, Psychological Review, 2026, DOI 10.1037/rev0000644;引述据 phys.org 2026 年 7 月报道。本文为科普解读,非专业心理建议。

心理

你用来嘲笑别人的那条曲线,有一半是排序方法自己画的

2026 年 7 月 28 日 · 基思·斯坦诺维奇《对伪心理学说不》約 7 分

小蔡把那张曲线图截给我的时候,是拿它骂自己的:「越不行的人越觉得自己行,你说我是不是就那种?」二十七八岁的姑娘,大活儿一律拖到最后一刻,交完先给自己判一句废物。那张图叫邓宁-克鲁格曲线,饭桌上一句「越无知的人越自信」,就够把一个人的一整年定性了。2026 年,两位学者把画那张图的数据重新算了一遍,发现曲线里有相当一截是画法本身造出来的,修正之后,箭头指向了反方向。

30 秒读懂
1重算

有人把那张著名的曲线拆开,重新算了一遍

动手的是两位做行为经济的学者。

论文 2026 年登在《心理学评论》上,DOI 10.1037/rev0000644。材料是一份大型复现数据集,数千名参与者,每人先做一份测验,再估一次自己考得怎么样。流程跟当年那项经典研究一模一样。

差别只在统计模型上。以往画这张图,默认考试分数约等于能力本身。这次的模型多开了两个口子:一个装考试成绩里的随机成分,一个装自我预测里的随机成分。随机成分说白了就是那天的手气,加上你随口一估时的偏差。口子一开,那条被引用二十多年的曲线塌了一大截。

为什么值得看:这条曲线大概是心理学里被转发最多的一张图。它塌掉的方式,比它本身更值得学一遍。

2陷阱

先按分数把人分组,这道工序自己就会画出一条曲线

出问题的地方不在参与者的脑子里,在他们被排进哪一格。

一场考试的分数,永远是两样东西加在一起:你真会多少,加上那天的手气。题目正好压中你翻过的那几页,蒙对三道选择题,都算。把人按分数从低到高切成四组,最低那组里必然混进一批运气差的人,真实水平比那个分数好看得多。

接着让这批人估自己考得如何。他们报出的数字其实挺贴近真实水平,并不离谱。可研究者把这个估计拿去和那个被运气压低的分数一比,落差就出来了,读起来就成了「高估自己」,曲线左端被顶高一截。de Meza 的原话是,单纯按考试成绩给参与者排序,「会在数学上扭曲数据,制造出一个并不存在的心理学现象」。

高分那头是镜像:最高一组里混着当天手气好的人,估计低于那个被运气抬高的分数,看上去就成了「谦虚」。两头一顶一压,那条收敛的曲线就画成了。它描述的更多是分组的方式,跟被分组的人关系不大。

回头说小蔡。她每次咨询提前二十分钟到,在楼下便利店站着喝完一盒常温酸奶才肯上楼。就这么个人,拿一次交得难看的活给自己排了序,对着那张图问我是不是「不知道自己不知道」的那种。我没顺着她的问法答,只问了一句:「那回的分数里,有多少是你的本事,有多少是那两周的手气?」

あの曲線の半分は並べ替えが描いたもの点数はどこから来るか / INPUT本当の実力実際に分かる量偶然の運その日のばらつきテストの点数実力と運が混ざる点数で人を並べ替えるこの工程だけで効果が出る平均への回帰と同じ罠おなじみのあの曲線低得点の人ほど自信満々に見えるその一部は並べ替えが作った偶然の成分を織り込むと自信過剰は広く見られる能力が高い人ほど自信過剰矢印が逆を向く有能な人ほど高く見積もる並べ替えが雑音を増幅主な因果偶然のばらつき
出典:Dawson & de Meza, Psychological Review 2026; DOI 10.1037/rev0000644。素点で並べ替えるだけで低得点層の「過大評価」が数学的に膨らむ。偶然を織り込むと、自信過剰は広く見られ能力の高い人ほど強い。枠組:スタノビッチ『心理学をまじめに考える方法』。科学解説であり、専門的な心理助言ではない。
打个比方

用一杆有点晃的秤称一百袋米,把最轻的十袋挑出来换准秤复称,平均会比第一次重。不是米在长,是第一次称最轻的那几袋里,混着几次读数偏低的。拿第一次的读数当真,就能写出「轻米会自己变重」。

3同一副面孔

体检复查和邓宁-克鲁格曲线,栽在同一个坑里

按结果排序再看差异,这动作在统计里有个老名字。

均值回归。挑出体检里血压最高的一百人,什么都不干,三个月后复测,平均值会往下走一点,因为第一次量得最高的人里,总有一部分那天正好紧张。

邓宁-克鲁格曲线是这个动作的另一副面孔:先用一次带噪声的测量给人排序,再拿排序后的组去和别的东西比。均值回归的结论是「数字会往回走」,听着像统计课的例题;这一版的结论是「无能的人自信满满」,听着像人性洞察。同一个陷阱,后一种说法更像在讲人,所以传得远得多。

旧读法

低分组高估自己,说明他们缺乏元认知能力。

新读法

低分组里混着运气差的人,那点落差有一部分是分组方式送的。

4反转

模型修好之后,箭头掉了个头

曲线塌掉只是第一步,接下来那个结果更难消化。

把两处随机成分都建模进去,剩下的图景:过度自信普遍存在,而且能力更高的人往往更过度自信。Dawson 的说法是,那个「无能者自信满满」的流行形象,「告诉我们的与其说是人类心理,不如说是统计分析里藏着的陷阱」。

研究者没有把话说死。他们留了余地:低能力者有时确实可能缺乏元认知能力,也就是不知道自己不知道。但在他们的解读里,过度自信更像一种信号激励在起作用,即向别人显示自己行,这一点在高能力人群里尤其明显。

它把过度自信从「认知缺陷」挪到了「对外表态」。一个人说自己有八成把握,可能真信八成,也可能他清楚只有说到八成才有人把活交给他。两种情形在数据里长得一样。这话我听着也不舒服:我写「大概是这样」的时候,那份笃定有几分是证据给的,几分是怕你划走,我也分不清。

那这条曲线,以后还能怎么用

斯坦诺维奇那本书的用处,正好落在这种时候。

《对伪心理学说不》反复讲一件事:判断一个心理学主张,先看证据是怎么来的。样本怎么选,组怎么分,相关有没有被当成因果。这条曲线过去二十多年贴在无数张幻灯片上,顺手到几乎能套住任何一个你看不惯的人。这份顺手本身就是提醒:概念的流行度和支撑它的证据强度,中间没有必然联系。

下次再遇到按「最差的一组」「最好的一组」讲故事的研究,先问两句:这组人是按什么排进来的?那个指标里有多少随机成分?

2023 年春天,我做完最后一个咨询赶十号线末班车,把一种很多人都有的困境匿名写成长文发了出去。凌晨两点多,留言里反复出现同一句:「原来不只我一个人这样。」这篇论文修正之后剩下的那半截,说的是同一件事的冷版本:你自己大概率也在那张图上,而且要是你真比多数人强,落点可能还更偏一点。

至于身边那位「懂得不多但特别自信」的同事,这项研究没说他不存在,只是说你手里那张图证不了他。你哪天又想拿这条曲线给谁定性,能不能先在心里问一句:这个判断,是他那天的表现给你的,还是那一次排序替你下的?

口径说明:单项重新分析不等于领域定论,后续复现仍可能修正结论。本文为科普解读,非专业心理建议。

本文框架取材自基思·斯坦诺维奇《对伪心理学说不》(Keith Stanovich, How to Think Straight About Psychology)中关于证据等级、相关与因果、概念流行度不等于证据强度的论述。研究出处:Chris Dawson & David de Meza, Psychological Review, 2026, DOI 10.1037/rev0000644;引述据 phys.org 2026 年 7 月报道。本文为科普解读,非专业心理建议。