欺骗、检测与披露:大语言模型玩迷因游戏
人工智能
2026-05-15 v3
摘要
大型语言模型在越来越多地应用于多智能体环境中,这些环境的结局取决于社交智能,这促使对其交互能力的评估;然而现有研究仍然主要是经验性的,缺乏对智能体相互作用如何决定集体结果的理论理解。为此,我们引入了"迷因游戏"(Mini-Mafia),这是一种对社交推理游戏"Mafia"的四玩家简化版本,其中固定的夜间阶段将游戏简化为由黑帮、侦探和村民三方进行的单次关键交换。在此设置下,我们证明黑帮的胜率 由解析公式 预测,其中 、 和 分别代表黑帮的欺骗能力、侦探的披露能力和村民的检测能力。我们将这一解析框架转化为"迷因游戏基准测试",通过对游戏数据的贝叶斯推断,可为每个模型估计内在参数 、 和 。对于 个模型,仅需 个参数即可预测所有 种赛事组合的结果;在 5 折交叉验证中,该公式相对于随机基准实现了 的 Brier 分数降低。基准测试还揭示了一些反直觉的结果:Grok 3 Mini 是最强的检测者,GPT-5 Mini 是最强的披露者,两者都超越了 DeepSeek V3.1、Claude Opus 4 和 Claude Sonnet 4;而 Claude Sonnet 4 是最弱的检测者,接近随机水平。总之,这些结果表明,迷因游戏作为一种简单但非平凡的多智能体系统,能够被解析描述,并可作为语言模型交互的原则性基准。
引用
@article{arxiv.2509.23023,
title = {Deceive, Detect, and Disclose: Large Language Models Play Mini-Mafia},
author = {Davi Bastos Costa and Renato Vicente},
journal= {arXiv preprint arXiv:2509.23023},
year = {2026}
}
备注
Adds a validation section for the theoretical model and restructures the presentation