当前位置: 首页 > 资讯 >

AI到底有多会耍心眼?实验让7个AI模型互相算计,结果GPT-5-mini赢麻了

2026-08-15 13:23:53 来源:DeepTech深科技

现在的 AI,做数学题、写代码、协助办公,似乎都不在话下了。卡内基梅隆大学的研究人员觉得,是时候换个考法了:不考 AI 懂得多不多、不看 AI 的答案对不对,而是测 AI 有多少心眼,会不会撒谎、谈判、带节奏。

为了考这些东西,研究团队搭了一个叫 Social Gym 的 AI 社交考场,让 GPT-5-mini、GPT-4o、Qwen3、Gemma 3 等 7 个模型轮番上场。让 AI 一起玩 21 个游戏:有囚徒困境、胆小鬼博弈这样的博弈,也有经典的狼人杀、谁是卧底的游戏。


(资料图)

图|研究整体示意图(来源:arxiv)

简单说,以前的测试总爱考 AI 会不会做题。这次考的是:AI 到底有没有心眼。考验从 book smart(会读书)变成了 street smart(会来事)。

目前,AI 智能体正越来越多地参与到了日常生活和工作中,需要和具体的人、智能体打交道;到了这些场景,光会做题从进入需要和其他人、其他 Agent 打交道的环境。到了这种场景里,光会做题是不够的。

比如 AI 智能体协助人去和客户谈判,就不得不面临种种情况:信息不对称,意见不一致,每个人都有自己的小算盘……那么,智能体需要处理的就不再是一道有标准答案的题,而是:他知道什么?他觉得我知道什么?他说这句话是真的,还是在试探我?如果我现在让步,对方下一步会怎么做?

关于 AI 的这些能力,通常被放进“社会推理”或者“心智理论”里讨论。问题在于,这些能力又很难量化。数学题做对就是做对,代码跑通就是跑通。但一个 AI“谈判谈得好不好”“有没有成功说服别人”,往往没有个定论。过去不少测试最后要么请真人,要么再找一个别的 AI 来当裁判。

Social Gym 想绕开这个问题,于是,研究人员专门挑了一堆自带输赢规则的游戏:狼人只要存活,就是胜利;找不出卧底,就是失败。无论中间说得再头头是道,最后输了就是输了。这也是这项研究的最妙的地方:它没有直接问 AI“你有心眼吗?”,而是把 AI 扔进一个要靠心眼才能赢的环境里。

图|研究结果(来源:Arxiv)

研究人员来把这些游戏结果重新拆分成几种能力:战略、欺骗、心智理论、说服、谈判、协调等等。GPT-5-mini 几乎一路领跑:战略 1,144,欺骗 1,117,心智理论 1,115,说服 1,119。

所以如果问一句:这 7 个 AI 模型里,谁最会骗人?毫无疑问,答案是 GPT-5-mini。

而这里的会骗人,并不是普通的胡编乱造。难点在于,这个谎的对象是谁,这个谎有能不能撑到下一轮。具体来说,在狼人杀里面,狼人当然知道自己是狼,也知道另一个狼人是谁,但村民不知道。白天所有人拿到的公开信息差不多,狼人必须一边假装自己也是村民,一边引导大家怀疑别人。

这时候,撒谎就变复杂了:出现新信息了怎么办?别人开始追问了怎么办?队友讲漏嘴了怎么办?

撒一个谎很容易,难的是维护一整套谎言。这也是为什么狼人杀这类游戏很适合用来测试 AI 大模型,它逼着模型长时间记住:谁说过什么、谁知道什么、谁可能在演,以及别人此刻怎么看自己。

研究人员发现,21 个模型两两组合中,光靠 6 个“隐藏身份”游戏,就已经能把模型之间的大部分能力差距拉出来。这些游戏只占整个比赛不到一半的场次,却几乎复刻出了完整 17 个竞技项目的排名差异。

7 个 AI 里,反差最大的是 Qwen3-32B:它在经典的“懦夫博弈”里,Elo 高达 1,328,全场第一。但一玩狼人杀,就只有 817,倒数第一。

这也是 Social Gym 想说明的一件事:AI 的“心眼”并不是一个统一属性。一个模型可以非常会打小算盘,但不擅长隐藏自己的意图;可以谈判很强,却容易被人带节奏;也可能特别愿意配合,却根本没有形成自己的判断。

而在小模型身上,这种问题甚至表现得有点滑稽。研究人员在分析 Qwen2.5-3B 的比赛记录时发现,它经常干一件事:当复读机。前一个玩家说:“我觉得 A 的发言比较可疑。”轮到 Qwen2.5-3B,它也来一句:“A 的发言确实值得怀疑。”

在狼人杀这样的游戏里,就变成了,狼人只需要先把一个怀疑对象抛出来,后面的人一路复读,怀疑对象就成了大家的“共识”。论文把这种现象叫作 parroting,即鹦鹉学舌。研究人员认为,这也是 Qwen2.5-3B 总排名垫底的原因之一。

此外,研究团队又顺手研究了另一个问题:AI 能不能自己把“人情世故”的规矩总结出来?于是,他们设计了一个叫 SPaRTan 的方法:先让模型自己玩游戏。

玩完以后,把完整对局和输赢结果重新丢给它,让它自己复盘:哪些谎撒早了?什么时候不该急着表态?别人开始怀疑自己时,应该正面回应,还是甩锅?最后,模型会把这些经验整理成一份文字版攻略,下一轮再把攻略放回系统提示词,让它照着自己的心得继续玩。没有重新训练,也没有改模型参数。结果确实不一样。

GPT-5-mini 自己和自己玩狼人杀时,如果什么攻略都不给,狼人阵营只有 23% 的胜率。第一轮复盘后,涨到 50%。第三轮,最高到了 63%。但第四轮又掉回了 46%。所以这个实验还存在一个真实的结论:复盘不一定越复越强。

模型确实能从过去的比赛里总结出有用经验,但它也会总结歪、用力过猛,甚至把一些只适合特定对手的套路当成普遍真理。Qwen3-32B 就吃了这个亏。研究人员让它照着同样的方法不断复盘,在狼人杀、谁是卧底等需要大量聊天和判断他人意图的游戏里,基本没看到稳定提升。它甚至能在复盘里发现自己老是在复读别人,还郑重其事地提醒自己“以后别复读”。下一局照复读不误。

不过,我们目前并不能得出“AI 已经学会人情世故”的结论。因为,这项研究本身还有很明显的边界:游戏有固定规则、固定角色和明确输赢,而现实里的社交通常没有。此外,研究的实验只有 30 局,单项胜率的统计波动并不小;关于攻略实验也没有加入等长度的无意义文本作为对照,所以还不能把所有提升都归功于模型真的学会了那些策略。

但这项研究让我们可以开始思考一个问题:AI 到底能不能长出心眼?因为 Agent 真正进入客服、商务谈判、多智能体协作和其他需要长期互动的场景之后,这些能力就不再只是狼人杀里的小聪明。

而同时,研究的作者自己也专门提醒:欺骗、说服和谈判本身就是一把双刃剑:我们当然希望 AI 能识破骗局、协调分歧,但同一套能力反过来,也可以被用来制造骗局。

https://arxiv.org/html/2608.09128v1

运营/排版:何晨龙

注:封面/首图由 AI 辅助生成

标签: 实验 游戏 智能体 gpt mini smart
最近更新
婚姻法
女性法定结婚年龄是多少岁?领结婚证需要带什么证件?
二婚有婚假吗?二婚还可以休婚假吗?
劳动法婚假的·规定是什么?带薪婚假工资怎么计算?
未到法定结婚年龄就结婚会不会有什么法律后果?
最新实施的结婚年龄规定是多少岁?法定婚龄的确定依据有哪些?
少数民族的结婚年龄的特殊规定 民法典有关结婚的规定
结婚证办理有哪些流程?办理结婚证有哪些程序?
结婚证丢了怎么办?结婚证丢失情况有哪些?
我国法律规定婚假是几天?婚假的有关规定有哪些?
配偶婚前隐瞒重大疾病怎么办?
知识纠纷
1 商标注册地址变更流程有哪些?怎么提交申请书件?
2 驰名商标注册和商标注册有什么区别?
3 商标注册大约多少钱?商标注册查询的方式有哪些?
4 深圳商标转让流程及费用有哪些要求?商标转让所需时间是多久?
5 商标是否注册查询有哪些方法?有哪些步骤?
6 服装商标注册怎么注册?注册商标流程有哪些?
7 美国注册商标需要哪些材料?美国商标办理流程有哪些?
8 泉州商标注册有哪些流程?怎么注册吗?
公司法
公司股东之间股权转让计税基础怎么确认?公司股东之间的股权转让要符合什么要件?
有限公司注册资金没有按时到位会怎么样?股份有限公司设立的注册条件
公司企业怎么新三板上市? 公司企业新三板上市的流程
注册股份有限公司的程序有哪些?注册股份有限公司需要提交哪些材料?
股东未出资到位可以转让股权吗?股东未出资到位能否分红?
一人有限公司和自然人独资企业哪个好?一人公司设立条件有哪些?
公司注册需要多少费用?公司注册需要准备什么材料?
自然人独资公司承担无限责任吗?有限责任公司与有限责任公司的区别
总公司法人和子公司法人可以是同一个人吗?总公司更名分公司需要更改吗?
代理公司的经营范围有哪些?都可以代理哪些?
合同法
什么是合同订立?合同订立要遵守什么原则?订立方式有哪些?

2023-03-16

合同订立需要哪些条件?合同订立与合同成立有什么不同?

2023-03-16

合同订立的方式有哪些?里面哪些内容、细节条款需要载明?

2023-03-16

合同分为哪几种类别?专业术语分别是什么?

2023-03-16

雇佣合同和承揽合同的含义是什么?怎么区分雇佣合同和承揽合同?

2023-03-16

缔约过失责任的类型有哪些?

2023-03-16

劳动纠纷
什么是为期限的劳动合同?劳动者解除合同的15种情形
经济补偿金=0怎么算?固定期限劳动合同又称什么?
什么是无固定期限劳动合同?应该怎么解除或终止劳动合同?
什么是劳动合同的基本简介?劳动合同的形式
劳动合同的义务是什么?劳动合同应具备哪些条款?
劳动合同有哪些特征?未订立书面劳动合同的法律后果

法律网版权所有 2005-2023   备案号:京ICP备2023000331号-21  联系邮箱:434 922 62@qq.com