vlog
← 返回全部文章

Psychology

Half the findings don't survive a rerun. That's the system working.

July 5, 2026 · Dana Cole, How to Think Straight About Psychology~5 min read

You know the feeling where you read a headline — "study finds that standing in a power pose for two minutes changes your hormones", say, or something about willpower being a finite fuel — and you quietly rearrange a corner of your life around it? I've done it more than once, which is a bit embarrassing for someone who used to teach this for a living. So I want to tell you what a very large study just found, not to make you cynical, but to hand you something more useful: a way of reading the next one.

What the study actually found

This spring, a team led by Brian Nosek — he runs the Center for Open Science — reported the results of the biggest, most systematic replication effort anyone has attempted. Independent groups took a large batch of published findings across psychology, economics and neighbouring fields, and simply reran the experiments to see what came back. The headline, reported by UVA Today and Forbes in April, is that only about half of them replicated. Roughly one in two. The other half either shrank, wobbled, or didn't show up at all the second time round.

Now, before your stomach drops, let me be careful about what that number is and isn't. "About half" is the honest, approximate shape of it — not a precise decimal I'd want you to quote at a dinner party, and itself an estimate from one (very large) effort. And here's the part people skip: a finding that "failed to replicate" is not the same as a finding that's false. It means the effect wasn't confirmed on rerun — it came back weaker, or absent, or only under conditions nobody had pinned down. Not-yet-confirmed, not debunked. The difference matters, and losing it is how you get from a sober result to the lazy conclusion that psychology is all made up.

Why this isn't the scandal it sounds like

Here's the reframe I'd actually stand behind. When a field builds machinery whose whole job is to catch its own mistakes — and then that machinery catches a great many of them, in public, on the record — that is not the field falling apart. That's the field doing exactly the thing that makes it a science in the first place.

Keith Stanovich has been making this point for decades in How to Think Straight About Psychology, and it lands harder than ever this week. Science, he keeps insisting, isn't a gallery of finished truths handed down by geniuses. It's cumulative and probabilistic — a slow, self-correcting grind where knowledge is always provisional, always up for revision. The whole distinction between real science and the pseudoscience that mimics it, he argues, isn't the subject matter. It's the method: public, testable, and willing to be wrong out loud. A replication study is that willingness made concrete. The awkward number isn't a betrayal of the science. It's the receipt.

The smell test you already half-knew

So what do you do with this, standing in the supermarket queue reading a psychology headline on your phone? Stanovich gives you a little hierarchy of evidence, and it's worth carrying around. At the bottom, weakest of all, sits the testimonial and the anecdote — the "I tried it and it changed my life" that self-help runs on. Above that, a single correlational study: X and Y turn up together, which tells you less than it sounds like (correlation isn't causation, and the arrow could point either way). Above that, a controlled experiment. And at the top, the thing you should actually trust: converging evidence — many separate studies, different teams, different methods, all quietly arriving at the same place.

The replication result is basically that hierarchy, proven the hard way. Any lone splashy finding — the one that's new, surprising, perfectly designed for a headline — is precisely the one most likely to be in the half that won't hold up. It's a single, weak signal wearing the costume of a strong one. Whereas a boring, well-worn conclusion that a dozen labs have circled back to from different directions is the one that's earned your weight. The chorus, not the solo.

TRUST THE CHORUS, NOT THE SOLOONE SPLASHY STUDY · WEAK SIGNALA viral headlineone study, one teamrerun by others…Holds upabout halfthe timeFades or shrinksthe otherroughly half≈ 1 in 2 replicatesMANY STUDIES AGREE · STRONG SIGNALindependent teams,methods & samplesConvergingevidence youcan lean onone study · weakmany agree · strong
A 2026 replication effort led by Brian Nosek at the Center for Open Science found that only about half of published social-science findings held up when independent teams reran them. "About half" is itself one estimate, and failing to replicate is not the same as being false. Framework: Keith Stanovich, How to Think Straight About Psychology (converging evidence beats any single study). Popular-science interpretation, not professional advice.

What this means the next time you read a headline

So here's the small, un-heroic toolkit I'd actually trust you to use. Four questions, none of them clever, all of them cheap. First: is this one study, or many? A lone finding — however elegant — is a bet, not a fact; give it the weight of an interesting maybe. Second: what would prove this wrong? That's Stanovich's oldest rule, borrowed from Popper — a claim that can explain any result whatsoever, that no possible observation could dent, isn't telling you anything (that's the difference between a testable finding and a horoscope). Third: expect the effect to shrink. Splashy first results tend to be the high-water mark; the truth, when it settles, is usually more modest. And fourth, the one I'd tattoo somewhere if I were the tattooing sort: distrust the single viral result most of all — the more perfectly it fits the headline, the more it's earned your suspicion, not your share button.

None of this asks you to sneer at psychology, and I'd be sad if that's what you took away. The half that replicated is real, hard-won knowledge, and the machinery that flagged the other half is the reason you can believe the first half at all. What it asks is gentler than cynicism: hold any single finding loosely, and save your confidence for the day the studies start agreeing with each other. That's not a lower standard. It's the only one that's ever worked.

A finding that fails to replicate isn't a lie. It's a promise the field kept — to check its own work in public.

The half that survives is what you get to keep.

Framework from Keith Stanovich's How to Think Straight About Psychology (基思·斯坦诺维奇《对伪心理学说不》) — falsifiability, the hierarchy of evidence (testimonial < single correlational study < controlled experiment < converging evidence), and science as cumulative, probabilistic and self-correcting rather than settled by any lone study. News peg: a 2026 replication effort led by Brian Nosek of the Center for Open Science, reported by UVA Today and Forbes in April 2026, finding that roughly half of published social-science results replicate. "About half" is one estimate; "failed to replicate" means not-yet-confirmed, not false. Popular-science interpretation, not professional psychological advice.

心理

一半的研究经不起重做——这恰恰说明系统在正常运转

2026年7月5日 · 林晚,《对伪心理学说不》约 5 分钟

我有个来访者,前阵子读到一条标题——大意是「每天做两分钟自信姿势就能改变你的激素水平」——她认认真真照做了一个月,后来问我:「林姐,我是不是被骗了?」说实话,这个坑我自己也跳过。你有没有过这种时候:刷到一条心理学的爆款标题,就悄悄按它重新摆布了自己生活的一角?所以今天我想跟你聊一项刚出的大研究——不是要你从此谁都不信,而是想递给你一样更趁手的东西:一副读下一条标题的眼镜。

这项研究到底发现了什么

今年春天,一个由 Brian Nosek 带头的团队——他掌管着「开放科学中心」——公布了迄今为止规模最大、最系统的一次复现努力。一批独立的研究小组,把心理学、经济学和相邻领域里大量已发表的结论拿过来,老老实实把实验重做一遍,看看还能不能得出同样的结果。UVA Today 和《福布斯》4 月的报道里,那个标题数字是:大约只有一半复现出来了。差不多每两项里有一项。剩下那一半,要么效应变淡了,要么摇摆不定,要么第二次干脆就没出现。

先别急着心凉,我得把这个数字是什么、不是什么,说清楚。「大约一半」是它诚实的、大致的样子——不是一个我想让你拿去饭桌上炫耀的精确小数,而且它本身也只是这一次(很大的)努力得出的估计。还有个大家最爱跳过的地方:一项「没能复现」的结论,并不等于它「是假的」。它的意思是,重做时这个效应没被确认——它回来时更弱了、或者没出现、或者只在谁都没说清的条件下才成立。是「还没被证实」,不是「被拆穿了」。这个区别要紧得很;一旦把它弄丢,你就会从一个冷静的结果,滑到「心理学全是编的」那句偷懒的结论上去。

为什么这不是听起来的那种丑闻

这里我想给你换个角度,一个我自己真站得住的角度。当一个学科建起一套机器,这套机器的全部活儿就是揪出自己的错——然后它果然当众、有据可查地揪出了一大堆——这不是学科在垮塌。这恰恰是它在做那件让它一开始成其为科学的事。

基思·斯坦诺维奇在《对伪心理学说不》里,把这个道理讲了几十年,这一周听来格外扎实。他反复强调:科学不是一间陈列室,摆满天才递下来的、盖棺定论的真理。它是累积的、概率性的——一场缓慢的、自我纠错的苦活,里面的知识永远是暂时的、随时可修订的。真科学和那些模仿它的伪科学,分界不在题材,而在方法:公开、可检验、肯当众认错。一项复现研究,就是「肯认错」这件事落到了实处。那个别扭的数字,不是对科学的背叛,它是收据。

那套你其实早就半懂的「闻味法」

那你排队买菜、低头刷到一条心理学标题时,能拿它怎么办?斯坦诺维奇给了你一个小小的证据等级,值得随身带着。最底下、最弱的,是个人见证和轶事——「我试了,它改变了我的人生」那种,自助读物全靠它撑着。往上一格,是单个的相关研究:X 和 Y 一起出现了,可这比听起来能说明的少得多(相关不等于因果,而且箭头往哪边指都还两说)。再往上,是控制实验。最顶上、真正值得你信的那样东西,叫聚合证据——许多各自独立的研究,不同团队、不同方法,都悄悄落到了同一个地方。

这次的复现结果,基本上就是这套等级被硬碰硬地证明了一遍。任何一个刷屏的孤零零的发现——那个又新、又意外、简直是为标题量身定做的——恰恰最可能落在「站不住的那一半」里。它是个单一的弱信号,穿了件强信号的戏服。反过来,一条无聊的、被磨得发亮的老结论,十来个实验室从不同方向绕回来都指着它,那才是配得上你把重量压上去的。信合唱,别信独唱。

别信独唱,信合唱一项刷屏研究 · 弱信号一条爆款标题一项研究、一个团队别人重做后……站得住大约一半变淡或消失另外大约一半约每两项复现一项多项研究一致 · 强信号不同团队、不同方法与样本聚合证据才是你能倚靠的单一研究 · 弱多项一致 · 强
2026 年,开放科学中心(Center for Open Science)的 Brian Nosek 主导的一项大规模复现研究发现:已发表的社会科学结论中,只有大约一半在独立团队重做时仍站得住。「大约一半」本身也只是一个估计,而「未能复现」并不等于「是假的」。框架:基思·斯坦诺维奇《对伪心理学说不》(聚合证据胜过任何单一研究)。本文为科普解读,非专业建议。

下回你读一条标题时,这意味着什么

那我给你一副小小的、不那么英勇的工具吧,四个问题,一个都不聪明,全都便宜。第一问:这是一项研究,还是很多项?一个孤零零的发现——再漂亮也一样——是个赌注,不是个事实;给它一个「有点意思,也许吧」的分量就够了。第二问:什么情况能证明它错?这是斯坦诺维奇最老的一条规矩,从波普尔那儿借来的——一个能解释任何结果、没有任何观察能撼动它的说法,其实什么都没告诉你(一个可检验的发现,和一条星座运势,区别就在这儿)。第三问:预期这个效应会缩水。刷屏的头一批结果往往是最高水位线;等真相沉淀下来,通常都朴素得多。第四问,也是我要真会文身、就文在身上的那条:最要提防的,就是那个单独的、刷屏的结果——它跟标题贴得越严丝合缝,就越值得你怀疑,而不是越值得你点转发。

这些没有一条是要你去嘲笑心理学,你要是读完只带走了这个,我会挺难过。复现出来的那一半,是真真切切、来之不易的知识;而那台把另一半标出来的机器,正是你能够相信头一半的原因。它要你做的,比犬儒温柔得多:任何单一的发现,都轻轻拿着;把你的信心,留给那些研究开始彼此点头的那一天。这不是把标准放低了。这是唯一一个真管用过的标准。

一项没能复现的发现,不是一句谎话。它是这个学科守住的一个承诺——当众核对自己的作业。

活下来的那一半,才是你能揣走的。

框架取自基思·斯坦诺维奇《对伪心理学说不》——可证伪性、证据等级(个人见证 < 单个相关研究 < 控制实验 < 聚合证据),以及科学是累积的、概率性的、自我纠错的,而非由任何单一研究一锤定音。新闻由头:2026 年由开放科学中心的 Brian Nosek 主导的一项复现研究,UVA Today 与《福布斯》2026 年 4 月报道,发现已发表的社会科学结论大约有一半能复现。「大约一半」是一个估计;「没能复现」意思是「还没被证实」,不是「是假的」。本文为科普解读,非专业心理建议。

心理学

半分は追試に耐えない——それこそ、仕組みがちゃんと働いている証拠

2026年7月5日 · 三浦美咲、『心理学をまじめに考える方法』約 7 分

「これ、やれば変われるって書いてあったの」

来談された方が、スマホの見出しを見せてくれた。二分間パワーポーズをすると、ホルモンが変わる、みたいな話。まじめに一か月続けて、それから「私、だまされたのかな」と。

……人のこと言えないんだけど、私もそういう見出しに、生活の片すみをそっと組み替えたこと、何度もある。だから今日は、出たばかりの大きな研究の話をしたい。誰も信じるな、って言いたいんじゃなくて。次の見出しを読むときの、ちょっとしたメガネを渡したくて。

この研究が実際に見つけたこと

この春、Brian Nosek——「オープンサイエンスセンター」を率いる人——のチームが、これまでで最大で、いちばん体系的な再現の取り組みの結果を出した。独立したグループが、心理学・経済学・その周りの分野で発表済みの知見をたくさん取ってきて、実験をそのまま追試して、同じ結果が返ってくるか確かめた。UVA Today と Forbes が4月に伝えた見出しの数字は、再現したのは約半分だけ、というもの。だいたい二本に一本。残りの半分は、効果が薄れたか、ぐらついたか、二度目にはそもそも出てこなかった。

でも、気を落とす前に。この数字が何で、何じゃないかを、ちゃんと言っておきたい。「約半分」は、正直で、おおよその形なんですよね——飲み会で自慢げに言うような正確な小数じゃないし、それ自体も、この(とても大きな)一回の取り組みからの推定でしかない。それから、みんながいちばん飛ばしがちなところ。「再現しなかった」知見は、「偽だった」知見と同じじゃない。追試でその効果が確認されなかった、という意味——弱くなって戻ってきたか、出てこなかったか、誰もはっきりさせていない条件でだけ成り立ったか。「まだ確かめられていない」であって、「暴かれた」じゃない。この違いは大事で、これを取り落とすと、冷静な結果から「心理学なんて全部作りもの」という、なまけた結論へ、するっと滑ってしまう。

これは、聞こえるほどのスキャンダルじゃない

ここで、私が本当に信じられる、別の見方を置きたい。ある分野が、自分の間違いを見つけることだけを仕事にした機械を作って——そしてその機械が、実際にたくさんの間違いを、公然と、記録に残る形で見つけた。それは、分野が崩れていることじゃない。それこそが、そもそもそれを科学たらしめている、あのことをやっているんです。

キース・スタノヴィッチは『心理学をまじめに考える方法』で、この話を何十年もしてきた。今週は、いつにも増して腑に落ちる。科学は、天才が授けてくれた完成した真理を並べた陳列室じゃない、と彼は言い続ける。累積的で、確率的なんです——遅くて、自分で自分を直していく地道な作業で、そこにある知識はいつも暫定的で、いつでも書き直しうる。本物の科学と、それをまねる疑似科学の分かれ目は、題材じゃなくて方法にある、と彼は言う。公開されていて、検証できて、公然と間違える覚悟がある。再現研究は、その覚悟が形になったもの。あの気まずい数字は、科学への裏切りじゃない。それは、レシートなんです。

あなたが、じつは半分知っている「におい」の嗅ぎ方

じゃあ、レジに並んで、スマホで心理学の見出しを読むとき、どうすればいい? スタノヴィッチが、小さな証拠のランクをくれる。持ち歩く価値がある。いちばん下、いちばん弱いのが、体験談と逸話——「やってみたら人生が変わった」というやつで、自己啓発本はこれで持っている。その上が、一つの相関研究。X と Y が一緒に出てきた、という話で、聞こえるほどには何も言っていない(相関は因果じゃないし、矢印がどっち向きかもまだわからない)。その上が、統制実験。そしていちばん上、あなたが本当に信じていいのが、収束する証拠——別々の多くの研究が、別々のチーム、別々の方法で、そっと同じ場所にたどり着くこと。

今回の再現の結果は、要するにそのランクが、痛い形で証明されたもの。バズった、ぽつんと一つの発見——新しくて、意外で、まるで見出しのためにあつらえたようなやつ——こそが、「持ちこたえない半分」に入っている確率がいちばん高い。単一の弱い信号が、強い信号の衣装を着ているんですよね。反対に、退屈で、使い古された結論に、いくつもの研究室が別々の方向から戻ってきて指さしている、そういうものこそ、あなたの体重をかけるに値する。独唱じゃなくて、合唱を。

独唱ではなく、合唱を信じる話題の一本 · 弱い信号バズる見出し一つの研究、一チーム他が追試すると…再現するおよそ半分薄れる・消える残りのおよそ半分およそ二本に一本が再現多くの研究が一致 · 強い信号別々のチーム、別々の方法と標本収束する証拠これなら頼れる一本 · 弱い多数が一致 · 強い
2026年、オープンサイエンスセンター(Center for Open Science)のブライアン・ノセック率いる大規模な再現研究は、発表済みの社会科学の知見のうち、独立したチームが追試して持ちこたえたのは約半分だけだと示した。「約半分」という数字自体も一つの推定であり、「再現しなかった」ことは「偽である」ことと同じではない。枠組み:キース・スタノヴィッチ『心理学をまじめに考える方法』(収束する証拠は単一の研究に勝る)。科学解説であり、専門的な助言ではない。

次に見出しを読むとき、これが何を意味するか

じゃあ、小さくて、そんなに勇ましくない道具を渡します。四つの問い。どれも賢くないし、どれも安上がり。一つ目——これは一本の研究? それとも何本も? ぽつんと一つの発見は、どんなに美しくても、賭けであって事実じゃない。「ちょっと面白いかも」くらいの重さでいい。二つ目——何があればこれが間違いだとわかる? スタノヴィッチのいちばん古いルールで、ポパーから借りたもの。どんな結果でも説明できて、どんな観察でもへこませられない主張は、じつは何も言っていない(検証できる知見と、星占いの違いは、ここなんですよね)。三つ目——効果は縮む、と思っておく。バズった最初の結果は、たいてい最高水位で、真実が落ち着くと、もっと控えめなことが多い。四つ目、私がタトゥーを入れるタイプなら入れておくやつ——単独でバズった結果を、いちばん疑う。見出しにぴったり合っているほど、あなたのシェアボタンじゃなくて、あなたの疑いに値する。

これは、心理学をばかにしろって話じゃない。読み終えてそれだけ持って帰られたら、私はちょっと悲しい。再現した半分は、本物で、苦労して得た知識だし、もう半分に印をつけた機械こそが、最初の半分を信じられる理由なんです。それが求めているのは、シニシズムよりずっとやさしいこと——どんな単一の知見も、ゆるく持っておく。そして自分の確信は、研究どうしがうなずき合いはじめた日のために、とっておく。基準を下げてるんじゃない。これが、これまで唯一ちゃんと働いてきた基準なんです。

再現しなかった知見は、嘘じゃない。それは、この分野が守った約束——自分の作業を、公然と点検するという。

生き残った半分が、あなたが手元に置けるもの。

枠組みはキース・スタノヴィッチ『心理学をまじめに考える方法』より——反証可能性、証拠のランク(体験談 < 一つの相関研究 < 統制実験 < 収束する証拠)、そして科学は累積的・確率的・自己修正的であって、単一の研究で決着するものではない、ということ。ニュースの起点:2026年、オープンサイエンスセンターの Brian Nosek 率いる再現研究(UVA Today と Forbes が2026年4月に報道)が、発表済みの社会科学の結果のうち約半分が再現すると示した。「約半分」は一つの推定であり、「再現しなかった」は「まだ確かめられていない」という意味で、「偽」ではない。科学解説であり、専門的な心理の助言ではない。