vlog
← 返回全部文章

Psychology

让人打折扣的不是 AI 的判断,是「这是 AI 说的」那个念头

2026年8月10日 · 丹·艾瑞里《怪诞行为学》~1 min read

你有没有干过这种事:把 AI 给的一段建议原样转给朋友,没提来源。对方连连点头,还夸了句「想得真周到」。过了两天你补一句「其实那是 AI 写的」,他沉默了一下:「怪不得,我就觉得有点空。」同一段话,一个字没改,变的只有一个标签。今年 8 月的一项研究把这个场面搬进了实验室,名字起得很正式:道德图灵测试。

30 秒读懂
1框架

先告诉你啤酒里加了醋,你就真的觉得它难喝

期望效应说白了就一句:信息赶在体验之前到场,就能把体验本身改了。

丹·艾瑞里在《怪诞行为学》里讲过一个实验:请学生尝加了几滴醋的啤酒。事先被告知加了醋的人,喝完直摇头;喝完才被告知的人,不少觉得味道并不坏。同一杯酒,评价分岔只看那条信息什么时候到。同一本书里还有个价格版:标了高价的止痛药,止痛效果真的更好,哪怕药片本身一模一样。

这些证据都落在舌头和身体上。悬了多年的问题是:轮到更「高级」的活儿,比如判断一段道德论证有没有道理,标签还有这么大权力吗?毕竟我们都愿意相信,自己是看内容下结论的。说实话我也这么信。

为什么值得看:期望效应的经典证据多在味觉、价格、疗效这类主观体验上;这项新研究把它推进到「道德判断 × AI 标签」,并把「你以为的来源」和「真实来源」拆开,各算各的账。

2实验

一场道德图灵测试:先猜是谁写的,再表态服不服

两步走的设计,正好让信念和事实分了家。

230 名受试者面对 60 个伦理情境,既有经典电车难题那样的「非个人型」两难(扳动道岔就行),也有天桥变体那样的「个人型」两难,得亲手把人推下去,冲突激烈得多。每个情境配一段辩护理由,有的出自人手,有的出自 GPT-3.5 家族模型。受试者做两件事:先猜这段话是人写的还是 AI 写的,再表态认不认同。

核心

妙就妙在猜错上。识别准确率稳定高于随机,却始终低于 75%,「以为是 AI」和「真是 AI」经常对不上号。研究者正好能分开算账:折扣是挂在真实来源上,还是挂在受试者的信念上。

打个比方

像一场品酒会,只是一部分标签被悄悄换过:有些贴着「超市盒装酒」的杯子里,装的其实是名庄酒。散场统计打分,就看得出你的舌头听谁的:酒本身,还是杯子上那张纸。

AGREEMENT DROPS WITH THE LABEL, NOT THE SOURCEPLOS ONE · N = 230ACTUAL SOURCEBELIEVED SOURCEHuman-writtenAI-writtenBelievedhuman-writtenBelievedAI-writtenAgreement: normalAgreement: normalrated on its meritsrated on its meritsAgreement: discountedAgreement: discounteddocked for the labeldocked for the labelThe discount follows the beliefsame discount either wayDetection: above chance,yet under 75% accuratebelief drives the discountsource makes no difference
Source: PLOS One (2026-08-05), a moral Turing test with N = 230; agreement dropped whenever a judgment was believed to be AI-written, regardless of the real author; detection was above chance yet under 75% accurate. A single online experiment — defer to the original study.
3结果

折扣跟着「你以为」走,不跟真实来源走

人写的挨了 AI 的折扣,机器写的领了人的高分。

总体上,受试者并没有偏好人类答案;在特别棘手的道德情境里,机器生成的辩护反而更受青睐。真正硬的是下一条:受试者对「自己以为是 AI 生成」的理由系统性地更不认同,而这跟那段话真实出自谁手没关系。人写的被当成 AI 写的,照样挨折扣;机器写的被当成人写的,照样得高分。

被当成人写的

同一段辩护理由,认同度更高。

被当成 AI 写的

一字未改,认同度下滑,变的只有读者心里那个念头。

放回艾瑞里的框架,这就是加醋啤酒的道德版:标签抢在内容前面把态表了。我有个来访者小婳,第一次来就自报「我 INFP、回避型依恋、高敏感」,像念体检单,她说测出来那天特别踏实。词一到场,她就先不看那个具体的自己了。实验里的受试者做的是镜像动作:「AI 写的」这个词一到场,那段话具体讲了什么,也先不看了。这坑我也踩过:心里先冒出「一看就是 AI」,分扣完了,内容还没读完。

大家靠什么猜来源?语言线索:回复长度、错别字、第一人称代词,还有成本收益类的词,比如 lives、save。受试者尤其不买「算账式」推理的账,可能是因为预期 AI 爱做这种把人命折成数字的论证。研究者的解读:是动机性信念与内群体、外群体偏见在左右评价。说白了,在道德这种敏感地带,人先掂量「说话的是不是我们自己人」,再轮到内容本身。

4落点

把结论带回家之前,先看清三条边界,再拿走两个用法

它值得当真,但别当铁律。

边界有三。其一,这是线上情境实验,对道德两难的表态,不等于真实处境里会怎么做。其二,单一研究,230 人的样本说明的是趋势,量级与推广范围都得等重复验证。其三,实验用的是较老的 GPT-3.5 家族;换更强的模型,人和机器的文字更难分辨,识别率可能更低。

论文 2026 年 8 月 5 日发表于 PLOS One:《A moral Turing test: How belief and source shape detection of and agreement with LLM judgments》,作者 Basile Garcia、Crystal Qian、Stefano Palminteri;N=230,60 个伦理情境,含个人型与非个人型道德两难。

用法有两个,都不费事。头一个,重要内容做一次「盲评」:先读完、写下自己的判断,再去看它出自谁手。顺序一换,标签就抢不了先。另一个是反向自查:脱口而出「这一看就是 AI 写的」时,别急着定案,先问问扣掉的分是来自论证里的具体毛病,还是来自那个念头。别忘了,实验里受试者猜来源的准确率不到四分之三,你我未必更高。

下一次有人递给你一段有道理的话,你会先把它读完,还是先问一句「谁写的」?

取材声明:思考框架取自丹·艾瑞里《怪诞行为学》(期望效应:预先知道的信息会改写实际体验与判断)。研究解读基于 PLOS One 上述论文,属单一研究,结论有边界,具体以原始研究为准。本文为科普解读,非专业建议。

心理

让人打折扣的不是 AI 的判断,是「这是 AI 说的」那个念头

2026年8月10日 · 丹·艾瑞里《怪诞行为学》约 5 分钟

你有没有干过这种事:把 AI 给的一段建议原样转给朋友,没提来源。对方连连点头,还夸了句「想得真周到」。过了两天你补一句「其实那是 AI 写的」,他沉默了一下:「怪不得,我就觉得有点空。」同一段话,一个字没改,变的只有一个标签。今年 8 月的一项研究把这个场面搬进了实验室,名字起得很正式:道德图灵测试。

30 秒读懂
1框架

先告诉你啤酒里加了醋,你就真的觉得它难喝

期望效应说白了就一句:信息赶在体验之前到场,就能把体验本身改了。

丹·艾瑞里在《怪诞行为学》里讲过一个实验:请学生尝加了几滴醋的啤酒。事先被告知加了醋的人,喝完直摇头;喝完才被告知的人,不少觉得味道并不坏。同一杯酒,评价分岔只看那条信息什么时候到。同一本书里还有个价格版:标了高价的止痛药,止痛效果真的更好,哪怕药片本身一模一样。

这些证据都落在舌头和身体上。悬了多年的问题是:轮到更「高级」的活儿,比如判断一段道德论证有没有道理,标签还有这么大权力吗?毕竟我们都愿意相信,自己是看内容下结论的。说实话我也这么信。

为什么值得看:期望效应的经典证据多在味觉、价格、疗效这类主观体验上;这项新研究把它推进到「道德判断 × AI 标签」,并把「你以为的来源」和「真实来源」拆开,各算各的账。

2实验

一场道德图灵测试:先猜是谁写的,再表态服不服

两步走的设计,正好让信念和事实分了家。

230 名受试者面对 60 个伦理情境,既有经典电车难题那样的「非个人型」两难(扳动道岔就行),也有天桥变体那样的「个人型」两难,得亲手把人推下去,冲突激烈得多。每个情境配一段辩护理由,有的出自人手,有的出自 GPT-3.5 家族模型。受试者做两件事:先猜这段话是人写的还是 AI 写的,再表态认不认同。

核心

妙就妙在猜错上。识别准确率稳定高于随机,却始终低于 75%,「以为是 AI」和「真是 AI」经常对不上号。研究者正好能分开算账:折扣是挂在真实来源上,还是挂在受试者的信念上。

打个比方

像一场品酒会,只是一部分标签被悄悄换过:有些贴着「超市盒装酒」的杯子里,装的其实是名庄酒。散场统计打分,就看得出你的舌头听谁的:酒本身,还是杯子上那张纸。

认同度被标签打折,与真实来源无关PLOS ONE · N = 230真实来源以为的来源人写的AI 写的以为是人写的以为是AI 写的认同度正常认同度正常按内容打分按内容打分认同度打折认同度打折只因标签被扣分只因标签被扣分打折跟着『以为』走两边打折一样识别高于随机但准确率低于 75%信念驱动打折来源无差别
来源:PLOS One(2026-08-05)「道德图灵测试」,N = 230。只要被以为是 AI 写的,认同度就打折,与真实作者无关;识别准确率高于随机但低于 75%。单一在线实验,以原始研究为准。
3结果

折扣跟着「你以为」走,不跟真实来源走

人写的挨了 AI 的折扣,机器写的领了人的高分。

总体上,受试者并没有偏好人类答案;在特别棘手的道德情境里,机器生成的辩护反而更受青睐。真正硬的是下一条:受试者对「自己以为是 AI 生成」的理由系统性地更不认同,而这跟那段话真实出自谁手没关系。人写的被当成 AI 写的,照样挨折扣;机器写的被当成人写的,照样得高分。

被当成人写的

同一段辩护理由,认同度更高。

被当成 AI 写的

一字未改,认同度下滑,变的只有读者心里那个念头。

放回艾瑞里的框架,这就是加醋啤酒的道德版:标签抢在内容前面把态表了。我有个来访者小婳,第一次来就自报「我 INFP、回避型依恋、高敏感」,像念体检单,她说测出来那天特别踏实。词一到场,她就先不看那个具体的自己了。实验里的受试者做的是镜像动作:「AI 写的」这个词一到场,那段话具体讲了什么,也先不看了。这坑我也踩过:心里先冒出「一看就是 AI」,分扣完了,内容还没读完。

大家靠什么猜来源?语言线索:回复长度、错别字、第一人称代词,还有成本收益类的词,比如 lives、save。受试者尤其不买「算账式」推理的账,可能是因为预期 AI 爱做这种把人命折成数字的论证。研究者的解读:是动机性信念与内群体、外群体偏见在左右评价。说白了,在道德这种敏感地带,人先掂量「说话的是不是我们自己人」,再轮到内容本身。

4落点

把结论带回家之前,先看清三条边界,再拿走两个用法

它值得当真,但别当铁律。

边界有三。其一,这是线上情境实验,对道德两难的表态,不等于真实处境里会怎么做。其二,单一研究,230 人的样本说明的是趋势,量级与推广范围都得等重复验证。其三,实验用的是较老的 GPT-3.5 家族;换更强的模型,人和机器的文字更难分辨,识别率可能更低。

论文 2026 年 8 月 5 日发表于 PLOS One:《A moral Turing test: How belief and source shape detection of and agreement with LLM judgments》,作者 Basile Garcia、Crystal Qian、Stefano Palminteri;N=230,60 个伦理情境,含个人型与非个人型道德两难。

用法有两个,都不费事。头一个,重要内容做一次「盲评」:先读完、写下自己的判断,再去看它出自谁手。顺序一换,标签就抢不了先。另一个是反向自查:脱口而出「这一看就是 AI 写的」时,别急着定案,先问问扣掉的分是来自论证里的具体毛病,还是来自那个念头。别忘了,实验里受试者猜来源的准确率不到四分之三,你我未必更高。

下一次有人递给你一段有道理的话,你会先把它读完,还是先问一句「谁写的」?

取材声明:思考框架取自丹·艾瑞里《怪诞行为学》(期望效应:预先知道的信息会改写实际体验与判断)。研究解读基于 PLOS One 上述论文,属单一研究,结论有边界,具体以原始研究为准。本文为科普解读,非专业建议。

心理学

让人打折扣的不是 AI 的判断,是「这是 AI 说的」那个念头

2026年8月10日 · 丹·艾瑞里《怪诞行为学》約 5 分

你有没有干过这种事:把 AI 给的一段建议原样转给朋友,没提来源。对方连连点头,还夸了句「想得真周到」。过了两天你补一句「其实那是 AI 写的」,他沉默了一下:「怪不得,我就觉得有点空。」同一段话,一个字没改,变的只有一个标签。今年 8 月的一项研究把这个场面搬进了实验室,名字起得很正式:道德图灵测试。

30 秒读懂
1框架

先告诉你啤酒里加了醋,你就真的觉得它难喝

期望效应说白了就一句:信息赶在体验之前到场,就能把体验本身改了。

丹·艾瑞里在《怪诞行为学》里讲过一个实验:请学生尝加了几滴醋的啤酒。事先被告知加了醋的人,喝完直摇头;喝完才被告知的人,不少觉得味道并不坏。同一杯酒,评价分岔只看那条信息什么时候到。同一本书里还有个价格版:标了高价的止痛药,止痛效果真的更好,哪怕药片本身一模一样。

这些证据都落在舌头和身体上。悬了多年的问题是:轮到更「高级」的活儿,比如判断一段道德论证有没有道理,标签还有这么大权力吗?毕竟我们都愿意相信,自己是看内容下结论的。说实话我也这么信。

为什么值得看:期望效应的经典证据多在味觉、价格、疗效这类主观体验上;这项新研究把它推进到「道德判断 × AI 标签」,并把「你以为的来源」和「真实来源」拆开,各算各的账。

2实验

一场道德图灵测试:先猜是谁写的,再表态服不服

两步走的设计,正好让信念和事实分了家。

230 名受试者面对 60 个伦理情境,既有经典电车难题那样的「非个人型」两难(扳动道岔就行),也有天桥变体那样的「个人型」两难,得亲手把人推下去,冲突激烈得多。每个情境配一段辩护理由,有的出自人手,有的出自 GPT-3.5 家族模型。受试者做两件事:先猜这段话是人写的还是 AI 写的,再表态认不认同。

核心

妙就妙在猜错上。识别准确率稳定高于随机,却始终低于 75%,「以为是 AI」和「真是 AI」经常对不上号。研究者正好能分开算账:折扣是挂在真实来源上,还是挂在受试者的信念上。

打个比方

像一场品酒会,只是一部分标签被悄悄换过:有些贴着「超市盒装酒」的杯子里,装的其实是名庄酒。散场统计打分,就看得出你的舌头听谁的:酒本身,还是杯子上那张纸。

評価を下げるのはラベル、書き手ではないPLOS ONE · N = 230本当の作者思った作者人の文章AIの文章人と思ったAIと思った評価は通常評価は通常中身で評価中身で評価評価が下がる評価が下がるラベルで減点ラベルで減点減点は信念に従う同じ減点正解率は偶然以上でも75%未満信念が主因作者は不問
出典:PLOS One(2026-08-05、N = 230)。評価はラベルに従い、書き手には無関係。正解率は75%未満。単一のオンライン実験で、元の研究に準じる。
3结果

折扣跟着「你以为」走,不跟真实来源走

人写的挨了 AI 的折扣,机器写的领了人的高分。

总体上,受试者并没有偏好人类答案;在特别棘手的道德情境里,机器生成的辩护反而更受青睐。真正硬的是下一条:受试者对「自己以为是 AI 生成」的理由系统性地更不认同,而这跟那段话真实出自谁手没关系。人写的被当成 AI 写的,照样挨折扣;机器写的被当成人写的,照样得高分。

被当成人写的

同一段辩护理由,认同度更高。

被当成 AI 写的

一字未改,认同度下滑,变的只有读者心里那个念头。

放回艾瑞里的框架,这就是加醋啤酒的道德版:标签抢在内容前面把态表了。我有个来访者小婳,第一次来就自报「我 INFP、回避型依恋、高敏感」,像念体检单,她说测出来那天特别踏实。词一到场,她就先不看那个具体的自己了。实验里的受试者做的是镜像动作:「AI 写的」这个词一到场,那段话具体讲了什么,也先不看了。这坑我也踩过:心里先冒出「一看就是 AI」,分扣完了,内容还没读完。

大家靠什么猜来源?语言线索:回复长度、错别字、第一人称代词,还有成本收益类的词,比如 lives、save。受试者尤其不买「算账式」推理的账,可能是因为预期 AI 爱做这种把人命折成数字的论证。研究者的解读:是动机性信念与内群体、外群体偏见在左右评价。说白了,在道德这种敏感地带,人先掂量「说话的是不是我们自己人」,再轮到内容本身。

4落点

把结论带回家之前,先看清三条边界,再拿走两个用法

它值得当真,但别当铁律。

边界有三。其一,这是线上情境实验,对道德两难的表态,不等于真实处境里会怎么做。其二,单一研究,230 人的样本说明的是趋势,量级与推广范围都得等重复验证。其三,实验用的是较老的 GPT-3.5 家族;换更强的模型,人和机器的文字更难分辨,识别率可能更低。

论文 2026 年 8 月 5 日发表于 PLOS One:《A moral Turing test: How belief and source shape detection of and agreement with LLM judgments》,作者 Basile Garcia、Crystal Qian、Stefano Palminteri;N=230,60 个伦理情境,含个人型与非个人型道德两难。

用法有两个,都不费事。头一个,重要内容做一次「盲评」:先读完、写下自己的判断,再去看它出自谁手。顺序一换,标签就抢不了先。另一个是反向自查:脱口而出「这一看就是 AI 写的」时,别急着定案,先问问扣掉的分是来自论证里的具体毛病,还是来自那个念头。别忘了,实验里受试者猜来源的准确率不到四分之三,你我未必更高。

下一次有人递给你一段有道理的话,你会先把它读完,还是先问一句「谁写的」?

取材声明:思考框架取自丹·艾瑞里《怪诞行为学》(期望效应:预先知道的信息会改写实际体验与判断)。研究解读基于 PLOS One 上述论文,属单一研究,结论有边界,具体以原始研究为准。本文为科普解读,非专业建议。