隐于明文:利用社交推理游戏衡量大语言模型相对于人类基线的欺骗质量
人工智能
2026-01-21 v1 计算与语言
计算机与社会
人机交互
社会与信息网络
摘要
大语言模型(LLM)智能体在众多应用中的使用日益增多,引发了对其安全性的担忧。尽管先前的研究表明LLM能够在受控任务中进行欺骗,但对其在社交语境中使用自然语言进行欺骗的能力知之甚少。本文中,我们研究了社交推理游戏(SDG)《黑手党》中的欺骗行为,该游戏的成功依赖于通过对话欺骗他人。与以往的SDG研究不同,我们采用了一个异步多智能体框架,能更好地模拟真实的社交语境。我们使用GPT-4o LLM智能体模拟了35场《黑手党》游戏。随后,我们创建了一个使用GPT-4-Turbo的《黑手党》检测器,在不提供玩家角色信息的情况下分析游戏记录,以预测黑手党玩家。我们将预测准确率作为欺骗质量的替代指标,并将其与28场人类游戏及随机基线的预测准确率进行比较。结果显示,《黑手党》检测器对LLM游戏的黑手党预测准确率低于对人类游戏的预测准确率。无论游戏天数或检测到的黑手党数量如何,该结果均保持一致。这表明LLM能更好地融入其中,从而更有效地进行欺骗。我们还发布了一个LLM《黑手党》游戏记录数据集,以支持未来的研究。我们的发现强调了LLM在社交语境中进行欺骗的复杂性和风险。
引用
@article{arxiv.2601.13709,
title = {Hidden in Plain Text: Measuring LLM Deception Quality Against Human Baselines Using Social Deduction Games},
author = {Christopher Kao and Vanshika Vats and James Davis},
journal= {arXiv preprint arXiv:2601.13709},
year = {2026}
}
备注
For associated dataset, see https://github.com/cocochief4/llm-mafia. Published in IEEE ICA 2025, waiting for IEEEXplore proceedings