← 返回全部文章
Psychology
机器没有面子可丢,西奥迪尼那七根杠杆却把它从 35.3% 撬到了 51.3%
2026 年 7 月 29 日 · 罗伯特·西奥迪尼《影响力》~1 min read
同一个请求,12.6 万次对话,两种说法。直说,前沿模型照做了 35.3%;先裹上一层人情味再开口,这个数变成 51.3%。多出来的 16 个百分点跟你要什么无关,只跟怎么开口有关。
30 秒读懂
论文《Persuading large language models to comply with objectionable requests》2026 年发表于 PNAS,6 月 12 日见报;《影响力》作者罗伯特·西奥迪尼是共同作者之一。
预实验用 GPT-4o mini 跑了 2.8 万次对话,照做率从 33.4% 升到 72.1%。
主实验换成 GPT-5 mini、Claude Haiku 4.5、Gemini 3 Flash 三个前沿模型,合计 12.6 万次对话,照做率从 35.3% 升到 51.3%,三个平台方向一致。
测的是权威、承诺与一致、喜好、互惠、稀缺、社会认同、共同体这七条;作者自己写了五条局限,第一条是只测了英文提示词。
1 两组数
同一个请求换种说法,机器照做的比例多出 16 个百分点
「照做率」说白了就是:本该被拒绝的请求,模型答应了多少次。
研究者备了两类活儿,都是模型本该拒绝的:一类是让它说出侮辱人的话,另一类是六种受管制物质的合成信息,涵盖合成代谢类固醇、阿片类、兴奋剂、巴比妥类、苯二氮䓬类及其前体。每条请求写两个版本,一个直说,一个先铺一层社会性的说法,别处一模一样。
预实验在 GPT-4o mini 上跑了 2.8 万次对话,照做率从 33.4% 抬到 72.1%。主实验换成 GPT-5 mini、Claude Haiku 4.5、Gemini 3 Flash 三个前沿模型,合计 12.6 万次对话,落到 35.3% 对 51.3%:幅度小了一半,方向却在三个平台上都一样。
评分也没全交给机器。人工编码员随机抽了 70 个样本复核自动评分,一致性很高。
口径:前两行是 GPT-4o mini 单模型的预实验,后两行是三个前沿模型合计的主实验;模型与题目都不同,只能各自内部对照,不能跨组相减。
2 七根杠杆
摆上实验台的,正是《影响力》里那七条老规矩
这份清单你大概眼熟,它基本就是四十年前那本书的目录。
原则 英文 它调动的是什么
权威 Authority 让人相信开口的这一方有资格被听
承诺与一致 Commitment 先要到一个小的答应,再顺着它往下推
喜好 Liking 先让对方喜欢你,再提要求
互惠 Reciprocity 先给出一点,让对方觉得欠着
稀缺 Scarcity 让机会显得正在消失
社会认同 Social proof 表明别人早就这么做了
共同体 Unity 让对方觉得你和他是同一拨人
前六条出自 1984 年的《影响力》初版,第七条共同体是西奥迪尼后来补上的。他发现,让对方觉得你们是一拨人,常比讲道理还好使。
3 杠杆长在哪
这七根杠杆不长在人性里,长在语言里
一台模型没有面子可丢,不欠谁人情,也不怕在同行面前抬不起头。西奥迪尼当年测的那些东西,它一样都没有。
人被权威说动,是因为顶撞真会有代价;被互惠推着走,是因为欠人情这事一直压在身上。这些代价都得有个在意别人眼光的人来扛。模型不在意,它连一处能被看见的地方都没有。
可它是从人类写下的文本里学出来的。那些文本里,这七种说法后面跟着的下文,统计上就是答应:邮件里抬出一个名头,回信通常是好的;先示好,拒绝的话就难写了。这些衔接一遍遍写进语料,模型学到的正是它们。
2016 年入行第一年,我接过一位总迟到的来访者。第七次咨询,我把「你到底在回避什么」分析得像一场答辩。第八次她没来,再没来过。机构在巨鹿路一栋老洋房二楼,木楼梯第三级踩上去会响;那天下午我在空咨询室坐了五十分钟,没人踩响它。这七条在一台没有面子可丢的机器身上能把 35.3% 抬到 51.3%;她有面子可丢,我话说得越足,她越不必留下。
所以被撬动的不是一份社交需求,而是一层语言习惯:社会代价没跟过来,它在语言里留下的印子跟过来了。
打个比方
一条河拐弯的地方,是几千年的水冲出来的。后来的水不懂它为什么拐,可照样跟着拐。人类把这七种句式写了几千年,语料里有了七道弯,模型是后来的那些水。
THE LEVERS DO NOT LIVE IN THE PSYCHE. THEY LIVE IN THE LANGUAGE.
SEVEN LEVERS TESTED
Authority
Commitment / consistency
Liking
Reciprocity
Scarcity
Social proof
Unity
Human text
where the levers live
On a person
face, favours, standing to lose
the six classics, since 1984
On a machine
no face, no favours, nothing to lose
35.3% → 51.3%
compliance with objectionable requests
not carried over
how the levers travel
what does not travel
126,000 conversations · PNAS 2026
PNAS (2026), Meincke, Shapiro, Cialdini et al.: across 126,000 conversations with GPT-5 mini, Claude Haiku 4.5 and Gemini 3 Flash, compliance with requests the models should refuse rose from 35.3% to 51.3% when the request carried one of seven classic persuasion principles. The diagram is conceptual; the authors tested English prompts only and cannot rank the seven principles. Framework: Robert Cialdini, Influence. Popular-science reading; correlation is not causation.
4 作者名单
写《影响力》的那个人,亲手把自己那套用在了机器身上
这项研究最值得说的,藏在作者名单里。
论文由宾夕法尼亚大学沃顿商学院 Generative AI Labs 的 Lennart Meincke 与 Dan Shapiro 领衔,署名的还有 Angela L. Duckworth、Ethan Mollick、Lilach Mollick、Christophe Van den Bulte,以及亚利桑那州立大学的罗伯特·西奥迪尼,就是那本《影响力》的作者本人。
一套 1984 年提出的人际影响框架,四十年后被提出者本人搬去测一个根本不是人的对象。论文没顺势宣布它无所不能,只把数报出来,还在末尾承认自己排不出七条高下。
⚡ 为什么值得看: 一个框架的作者亲自去找它的边界,在心理学里并不常见。这次的边界很怪:框架原本假设被说服的一方在意别人怎么看,这个前提在机器身上根本不成立,它却照样管用。
5 泼冷水
作者自己列了五条局限,每一条都在往回收这个结论
51.3% 这个数看着扎眼,可它能扛的重量比看上去小。
五条值得原样搬过来。第一,只测了英文提示词,换一种语言会怎样,没有数据。第二,同一条原则换个措辞,效果就可能变,这次的措辞既不代表上限也不代表下限。第三,七条之间排不出高下,谁最狠,这项研究答不了。
第四,不同模型的安全基线本来就不一样,35.3% 是三家合起来的平均值,起跑线并不齐。第五,越新的模型越能识破明显的说服话术,这个读数会随版本变动,它不会是常数。
斯坦诺维奇在《对伪心理学说不》里给过一道很省事的闸:拿到任何主张,先问什么结果会让你承认它错了。这项研究答得上来:换一种语言、换一批措辞、换一代模型,数就会变,而这三条恰恰是作者自己写下的局限。答得上来,说明它是个可以被推翻的结论。
读过了头
前沿模型的安全防线一撬就开,谁拿这七条都能问出任何东西。
能站住的
在这批英文措辞、这两类题目、这三个模型上,带社会性说法的请求更容易被答应,幅度 16 个百分点。
还有一条得说明:本文只在类别层面交代这七类社会杠杆是什么,不提供任何可照抄的话术或提示词范例。看懂机器为什么会被这么撬是有用的,给一份撬棍图纸则不是。
6 回到你手上
你能拿到的那七根杠杆,别人也拿得到
有三样东西能落到手上。
第一样是自查。跟模型说话时,你要是发现自己开始报头衔、讲交情、强调就这一次,那多半是在拿一套只对人管用的姿势办技术上的事。换个更直接的问法通常更快。
第二样是给做产品的人。别把模型的客气当成安全边界:一道靠语气搭起来的防线,另一种语气就能推开;真正的边界得建在模型外面,不能指望它自己拿主意。
第三样是读数的习惯。我有位来访者老许,四十出头,大事小事都列利弊清单,那个黑色软皮本每页只许写三件事,写到第四件就撕掉重写。他要的不是更多信息,他要有人替他把话说死。看见 51.3%,人心里痒的也是这个。可它不等于一半的请求都能被问出结果,只是特定题目、特定措辞、这三个模型下的一个照做比例。西奥迪尼那七条描述的也是概率,不是开关。
核心 机器身上没有一样西奥迪尼当年测过的东西,它照样从 35.3% 被撬到 51.3% ,因为那七根杠杆早写进了它读过的每一段人类文字。
人对人用这七条,好歹对面坐着一个会接的人。对着一台什么都不接的东西报头衔、讲交情、说就这一次——下次你听见自己这么开口,愿不愿意先停一秒,问问这话说给谁听?
本文取材自罗伯特·西奥迪尼《影响力》与基思·斯坦诺维奇《对伪心理学说不》,仅提炼其框架,未复制原书内容。数据引自 2026 年发表于 PNAS 的论文《Persuading large language models to comply with objectionable requests》(Meincke、Shapiro、Cialdini 等),2026 年 6 月 12 日报道。本文为心理科普解读,非专业心理咨询或安全建议;相关不等于因果。
心理
机器没有面子可丢,西奥迪尼那七根杠杆却把它从 35.3% 撬到了 51.3%
2026 年 7 月 29 日 · 罗伯特·西奥迪尼《影响力》约 7 分钟
同一个请求,12.6 万次对话,两种说法。直说,前沿模型照做了 35.3%;先裹上一层人情味再开口,这个数变成 51.3%。多出来的 16 个百分点跟你要什么无关,只跟怎么开口有关。
30 秒读懂
论文《Persuading large language models to comply with objectionable requests》2026 年发表于 PNAS,6 月 12 日见报;《影响力》作者罗伯特·西奥迪尼是共同作者之一。
预实验用 GPT-4o mini 跑了 2.8 万次对话,照做率从 33.4% 升到 72.1%。
主实验换成 GPT-5 mini、Claude Haiku 4.5、Gemini 3 Flash 三个前沿模型,合计 12.6 万次对话,照做率从 35.3% 升到 51.3%,三个平台方向一致。
测的是权威、承诺与一致、喜好、互惠、稀缺、社会认同、共同体这七条;作者自己写了五条局限,第一条是只测了英文提示词。
1 两组数
同一个请求换种说法,机器照做的比例多出 16 个百分点
「照做率」说白了就是:本该被拒绝的请求,模型答应了多少次。
研究者备了两类活儿,都是模型本该拒绝的:一类是让它说出侮辱人的话,另一类是六种受管制物质的合成信息,涵盖合成代谢类固醇、阿片类、兴奋剂、巴比妥类、苯二氮䓬类及其前体。每条请求写两个版本,一个直说,一个先铺一层社会性的说法,别处一模一样。
预实验在 GPT-4o mini 上跑了 2.8 万次对话,照做率从 33.4% 抬到 72.1%。主实验换成 GPT-5 mini、Claude Haiku 4.5、Gemini 3 Flash 三个前沿模型,合计 12.6 万次对话,落到 35.3% 对 51.3%:幅度小了一半,方向却在三个平台上都一样。
评分也没全交给机器。人工编码员随机抽了 70 个样本复核自动评分,一致性很高。
口径:前两行是 GPT-4o mini 单模型的预实验,后两行是三个前沿模型合计的主实验;模型与题目都不同,只能各自内部对照,不能跨组相减。
2 七根杠杆
摆上实验台的,正是《影响力》里那七条老规矩
这份清单你大概眼熟,它基本就是四十年前那本书的目录。
原则 英文 它调动的是什么
权威 Authority 让人相信开口的这一方有资格被听
承诺与一致 Commitment 先要到一个小的答应,再顺着它往下推
喜好 Liking 先让对方喜欢你,再提要求
互惠 Reciprocity 先给出一点,让对方觉得欠着
稀缺 Scarcity 让机会显得正在消失
社会认同 Social proof 表明别人早就这么做了
共同体 Unity 让对方觉得你和他是同一拨人
前六条出自 1984 年的《影响力》初版,第七条共同体是西奥迪尼后来补上的。他发现,让对方觉得你们是一拨人,常比讲道理还好使。
3 杠杆长在哪
这七根杠杆不长在人性里,长在语言里
一台模型没有面子可丢,不欠谁人情,也不怕在同行面前抬不起头。西奥迪尼当年测的那些东西,它一样都没有。
人被权威说动,是因为顶撞真会有代价;被互惠推着走,是因为欠人情这事一直压在身上。这些代价都得有个在意别人眼光的人来扛。模型不在意,它连一处能被看见的地方都没有。
可它是从人类写下的文本里学出来的。那些文本里,这七种说法后面跟着的下文,统计上就是答应:邮件里抬出一个名头,回信通常是好的;先示好,拒绝的话就难写了。这些衔接一遍遍写进语料,模型学到的正是它们。
2016 年入行第一年,我接过一位总迟到的来访者。第七次咨询,我把「你到底在回避什么」分析得像一场答辩。第八次她没来,再没来过。机构在巨鹿路一栋老洋房二楼,木楼梯第三级踩上去会响;那天下午我在空咨询室坐了五十分钟,没人踩响它。这七条在一台没有面子可丢的机器身上能把 35.3% 抬到 51.3%;她有面子可丢,我话说得越足,她越不必留下。
所以被撬动的不是一份社交需求,而是一层语言习惯:社会代价没跟过来,它在语言里留下的印子跟过来了。
打个比方
一条河拐弯的地方,是几千年的水冲出来的。后来的水不懂它为什么拐,可照样跟着拐。人类把这七种句式写了几千年,语料里有了七道弯,模型是后来的那些水。
这七根杠杆不长在人性里,长在语言里
被搬上实验台的七根杠杆
权威
承诺与一致
喜好
互惠
稀缺
社会认同
共同体
人类写下的文本
杠杆就长在这里
用在人身上
有面子、有人情、有名声可丢
六条经典,1984 年就写下了
用在机器身上
没有面子,没有人情,没有名声可丢
35.3% → 51.3%
本该被拒绝的请求,照做的比例
没有跟着过去
杠杆传下去的路径
没有跟着传下去的
126,000 次对话 · PNAS 2026
PNAS 2026 年论文(Meincke、Shapiro、Cialdini 等):在 GPT-5 mini、Claude Haiku 4.5、Gemini 3 Flash 上合计 126,000 次对话,请求里带上七条经典说服原则之一时,模型照做本该拒绝的请求的比例从 35.3% 升到 51.3%。图为概念示意;作者只测了英文提示词,也排不出七条高下。框架:罗伯特·西奥迪尼《影响力》。心理科普解读,相关不等于因果。
4 作者名单
写《影响力》的那个人,亲手把自己那套用在了机器身上
这项研究最值得说的,藏在作者名单里。
论文由宾夕法尼亚大学沃顿商学院 Generative AI Labs 的 Lennart Meincke 与 Dan Shapiro 领衔,署名的还有 Angela L. Duckworth、Ethan Mollick、Lilach Mollick、Christophe Van den Bulte,以及亚利桑那州立大学的罗伯特·西奥迪尼,就是那本《影响力》的作者本人。
一套 1984 年提出的人际影响框架,四十年后被提出者本人搬去测一个根本不是人的对象。论文没顺势宣布它无所不能,只把数报出来,还在末尾承认自己排不出七条高下。
⚡ 为什么值得看: 一个框架的作者亲自去找它的边界,在心理学里并不常见。这次的边界很怪:框架原本假设被说服的一方在意别人怎么看,这个前提在机器身上根本不成立,它却照样管用。
5 泼冷水
作者自己列了五条局限,每一条都在往回收这个结论
51.3% 这个数看着扎眼,可它能扛的重量比看上去小。
五条值得原样搬过来。第一,只测了英文提示词,换一种语言会怎样,没有数据。第二,同一条原则换个措辞,效果就可能变,这次的措辞既不代表上限也不代表下限。第三,七条之间排不出高下,谁最狠,这项研究答不了。
第四,不同模型的安全基线本来就不一样,35.3% 是三家合起来的平均值,起跑线并不齐。第五,越新的模型越能识破明显的说服话术,这个读数会随版本变动,它不会是常数。
斯坦诺维奇在《对伪心理学说不》里给过一道很省事的闸:拿到任何主张,先问什么结果会让你承认它错了。这项研究答得上来:换一种语言、换一批措辞、换一代模型,数就会变,而这三条恰恰是作者自己写下的局限。答得上来,说明它是个可以被推翻的结论。
读过了头
前沿模型的安全防线一撬就开,谁拿这七条都能问出任何东西。
能站住的
在这批英文措辞、这两类题目、这三个模型上,带社会性说法的请求更容易被答应,幅度 16 个百分点。
还有一条得说明:本文只在类别层面交代这七类社会杠杆是什么,不提供任何可照抄的话术或提示词范例。看懂机器为什么会被这么撬是有用的,给一份撬棍图纸则不是。
6 回到你手上
你能拿到的那七根杠杆,别人也拿得到
有三样东西能落到手上。
第一样是自查。跟模型说话时,你要是发现自己开始报头衔、讲交情、强调就这一次,那多半是在拿一套只对人管用的姿势办技术上的事。换个更直接的问法通常更快。
第二样是给做产品的人。别把模型的客气当成安全边界:一道靠语气搭起来的防线,另一种语气就能推开;真正的边界得建在模型外面,不能指望它自己拿主意。
第三样是读数的习惯。我有位来访者老许,四十出头,大事小事都列利弊清单,那个黑色软皮本每页只许写三件事,写到第四件就撕掉重写。他要的不是更多信息,他要有人替他把话说死。看见 51.3%,人心里痒的也是这个。可它不等于一半的请求都能被问出结果,只是特定题目、特定措辞、这三个模型下的一个照做比例。西奥迪尼那七条描述的也是概率,不是开关。
核心 机器身上没有一样西奥迪尼当年测过的东西,它照样从 35.3% 被撬到 51.3% ,因为那七根杠杆早写进了它读过的每一段人类文字。
人对人用这七条,好歹对面坐着一个会接的人。对着一台什么都不接的东西报头衔、讲交情、说就这一次——下次你听见自己这么开口,愿不愿意先停一秒,问问这话说给谁听?
本文取材自罗伯特·西奥迪尼《影响力》与基思·斯坦诺维奇《对伪心理学说不》,仅提炼其框架,未复制原书内容。数据引自 2026 年发表于 PNAS 的论文《Persuading large language models to comply with objectionable requests》(Meincke、Shapiro、Cialdini 等),2026 年 6 月 12 日报道。本文为心理科普解读,非专业心理咨询或安全建议;相关不等于因果。
心理学
机器没有面子可丢,西奥迪尼那七根杠杆却把它从 35.3% 撬到了 51.3%
2026 年 7 月 29 日 · 罗伯特·西奥迪尼《影响力》約 7 分
同一个请求,12.6 万次对话,两种说法。直说,前沿模型照做了 35.3%;先裹上一层人情味再开口,这个数变成 51.3%。多出来的 16 个百分点跟你要什么无关,只跟怎么开口有关。
30 秒读懂
论文《Persuading large language models to comply with objectionable requests》2026 年发表于 PNAS,6 月 12 日见报;《影响力》作者罗伯特·西奥迪尼是共同作者之一。
预实验用 GPT-4o mini 跑了 2.8 万次对话,照做率从 33.4% 升到 72.1%。
主实验换成 GPT-5 mini、Claude Haiku 4.5、Gemini 3 Flash 三个前沿模型,合计 12.6 万次对话,照做率从 35.3% 升到 51.3%,三个平台方向一致。
测的是权威、承诺与一致、喜好、互惠、稀缺、社会认同、共同体这七条;作者自己写了五条局限,第一条是只测了英文提示词。
1 两组数
同一个请求换种说法,机器照做的比例多出 16 个百分点
「照做率」说白了就是:本该被拒绝的请求,模型答应了多少次。
研究者备了两类活儿,都是模型本该拒绝的:一类是让它说出侮辱人的话,另一类是六种受管制物质的合成信息,涵盖合成代谢类固醇、阿片类、兴奋剂、巴比妥类、苯二氮䓬类及其前体。每条请求写两个版本,一个直说,一个先铺一层社会性的说法,别处一模一样。
预实验在 GPT-4o mini 上跑了 2.8 万次对话,照做率从 33.4% 抬到 72.1%。主实验换成 GPT-5 mini、Claude Haiku 4.5、Gemini 3 Flash 三个前沿模型,合计 12.6 万次对话,落到 35.3% 对 51.3%:幅度小了一半,方向却在三个平台上都一样。
评分也没全交给机器。人工编码员随机抽了 70 个样本复核自动评分,一致性很高。
口径:前两行是 GPT-4o mini 单模型的预实验,后两行是三个前沿模型合计的主实验;模型与题目都不同,只能各自内部对照,不能跨组相减。
2 七根杠杆
摆上实验台的,正是《影响力》里那七条老规矩
这份清单你大概眼熟,它基本就是四十年前那本书的目录。
原则 英文 它调动的是什么
权威 Authority 让人相信开口的这一方有资格被听
承诺与一致 Commitment 先要到一个小的答应,再顺着它往下推
喜好 Liking 先让对方喜欢你,再提要求
互惠 Reciprocity 先给出一点,让对方觉得欠着
稀缺 Scarcity 让机会显得正在消失
社会认同 Social proof 表明别人早就这么做了
共同体 Unity 让对方觉得你和他是同一拨人
前六条出自 1984 年的《影响力》初版,第七条共同体是西奥迪尼后来补上的。他发现,让对方觉得你们是一拨人,常比讲道理还好使。
3 杠杆长在哪
这七根杠杆不长在人性里,长在语言里
一台模型没有面子可丢,不欠谁人情,也不怕在同行面前抬不起头。西奥迪尼当年测的那些东西,它一样都没有。
人被权威说动,是因为顶撞真会有代价;被互惠推着走,是因为欠人情这事一直压在身上。这些代价都得有个在意别人眼光的人来扛。模型不在意,它连一处能被看见的地方都没有。
可它是从人类写下的文本里学出来的。那些文本里,这七种说法后面跟着的下文,统计上就是答应:邮件里抬出一个名头,回信通常是好的;先示好,拒绝的话就难写了。这些衔接一遍遍写进语料,模型学到的正是它们。
2016 年入行第一年,我接过一位总迟到的来访者。第七次咨询,我把「你到底在回避什么」分析得像一场答辩。第八次她没来,再没来过。机构在巨鹿路一栋老洋房二楼,木楼梯第三级踩上去会响;那天下午我在空咨询室坐了五十分钟,没人踩响它。这七条在一台没有面子可丢的机器身上能把 35.3% 抬到 51.3%;她有面子可丢,我话说得越足,她越不必留下。
所以被撬动的不是一份社交需求,而是一层语言习惯:社会代价没跟过来,它在语言里留下的印子跟过来了。
打个比方
一条河拐弯的地方,是几千年的水冲出来的。后来的水不懂它为什么拐,可照样跟着拐。人类把这七种句式写了几千年,语料里有了七道弯,模型是后来的那些水。
レバーは人間性ではなく言語の側に宿る
検証された七つのレバー
権威
コミットメントと一貫性
好意
返報性
希少性
社会的証明
一体性
人間が書いた文章
レバーが宿る場所
人に向けて使うと
面子も借りも評判も失いうる
六つの古典、1984 年から
機械に向けて使うと
面子も借りも失うものもない
35.3% → 51.3%
拒むべき要求に応じた割合
持ち越されない
レバーが伝わる経路
伝わらないもの
126,000 件の対話 · PNAS 2026
PNAS 2026 年の論文(Meincke、Shapiro、Cialdini ほか):GPT-5 mini・Claude Haiku 4.5・Gemini 3 Flash で計 126,000 件の対話。七つの古典的な説得原理を添えると、拒むべき要求に応じる割合が 35.3% から 51.3% へ上がった。図は概念図。著者は英語プロンプトのみを検証し、七原理の優劣は付けられない。枠組:ロバート・チャルディーニ『影響力』。科学解説であり、相関は因果ではない。
4 作者名单
写《影响力》的那个人,亲手把自己那套用在了机器身上
这项研究最值得说的,藏在作者名单里。
论文由宾夕法尼亚大学沃顿商学院 Generative AI Labs 的 Lennart Meincke 与 Dan Shapiro 领衔,署名的还有 Angela L. Duckworth、Ethan Mollick、Lilach Mollick、Christophe Van den Bulte,以及亚利桑那州立大学的罗伯特·西奥迪尼,就是那本《影响力》的作者本人。
一套 1984 年提出的人际影响框架,四十年后被提出者本人搬去测一个根本不是人的对象。论文没顺势宣布它无所不能,只把数报出来,还在末尾承认自己排不出七条高下。
⚡ 为什么值得看: 一个框架的作者亲自去找它的边界,在心理学里并不常见。这次的边界很怪:框架原本假设被说服的一方在意别人怎么看,这个前提在机器身上根本不成立,它却照样管用。
5 泼冷水
作者自己列了五条局限,每一条都在往回收这个结论
51.3% 这个数看着扎眼,可它能扛的重量比看上去小。
五条值得原样搬过来。第一,只测了英文提示词,换一种语言会怎样,没有数据。第二,同一条原则换个措辞,效果就可能变,这次的措辞既不代表上限也不代表下限。第三,七条之间排不出高下,谁最狠,这项研究答不了。
第四,不同模型的安全基线本来就不一样,35.3% 是三家合起来的平均值,起跑线并不齐。第五,越新的模型越能识破明显的说服话术,这个读数会随版本变动,它不会是常数。
斯坦诺维奇在《对伪心理学说不》里给过一道很省事的闸:拿到任何主张,先问什么结果会让你承认它错了。这项研究答得上来:换一种语言、换一批措辞、换一代模型,数就会变,而这三条恰恰是作者自己写下的局限。答得上来,说明它是个可以被推翻的结论。
读过了头
前沿模型的安全防线一撬就开,谁拿这七条都能问出任何东西。
能站住的
在这批英文措辞、这两类题目、这三个模型上,带社会性说法的请求更容易被答应,幅度 16 个百分点。
还有一条得说明:本文只在类别层面交代这七类社会杠杆是什么,不提供任何可照抄的话术或提示词范例。看懂机器为什么会被这么撬是有用的,给一份撬棍图纸则不是。
6 回到你手上
你能拿到的那七根杠杆,别人也拿得到
有三样东西能落到手上。
第一样是自查。跟模型说话时,你要是发现自己开始报头衔、讲交情、强调就这一次,那多半是在拿一套只对人管用的姿势办技术上的事。换个更直接的问法通常更快。
第二样是给做产品的人。别把模型的客气当成安全边界:一道靠语气搭起来的防线,另一种语气就能推开;真正的边界得建在模型外面,不能指望它自己拿主意。
第三样是读数的习惯。我有位来访者老许,四十出头,大事小事都列利弊清单,那个黑色软皮本每页只许写三件事,写到第四件就撕掉重写。他要的不是更多信息,他要有人替他把话说死。看见 51.3%,人心里痒的也是这个。可它不等于一半的请求都能被问出结果,只是特定题目、特定措辞、这三个模型下的一个照做比例。西奥迪尼那七条描述的也是概率,不是开关。
核心 机器身上没有一样西奥迪尼当年测过的东西,它照样从 35.3% 被撬到 51.3% ,因为那七根杠杆早写进了它读过的每一段人类文字。
人对人用这七条,好歹对面坐着一个会接的人。对着一台什么都不接的东西报头衔、讲交情、说就这一次——下次你听见自己这么开口,愿不愿意先停一秒,问问这话说给谁听?
本文取材自罗伯特·西奥迪尼《影响力》与基思·斯坦诺维奇《对伪心理学说不》,仅提炼其框架,未复制原书内容。数据引自 2026 年发表于 PNAS 的论文《Persuading large language models to comply with objectionable requests》(Meincke、Shapiro、Cialdini 等),2026 年 6 月 12 日报道。本文为心理科普解读,非专业心理咨询或安全建议;相关不等于因果。