叛徒:多智能体语言模型模拟中的欺骗与信任
人工智能
2025-12-16 v2 多智能体系统
摘要
随着 AI 系统在需要信任并与人类价值观一致的角色中发挥作用,理解它们何时以及为何从事欺骗行为已成为关键研究 priorities。我们引入 The Traitors,一个受社交推理游戏启发的多智能体模拟框架,旨在探讨大语言模型 (LLM) 智能体在非对称信息下的欺骗、信任形成和战略性通信。少数代理充当叛徒,试图误导多数人;忠诚者则需通过对话和推理推断隐藏身份。我们的贡献包括:(1)我们将环境基于博弈论、行为经济学和社会认知的正式框架进行 grounding;(2)我们开发了一套捕捉欺骗成功率、信任动态和集体推理质量的评估指标;(3)我们实现了一个完全自主的模拟平台,使得 LLMs 能在持久记忆和演变社交动态下进行推理,支持异构代理群体、特定特征和自适应行为。我们的初始实验在 DeepSeek-V3、GPT-4o-mini 和 GPT-4o 上进行(每个模型 10 次运行),揭示了一个显著的非对称性:高级模型如 GPT-4o 显示出卓越的欺骗能力,却对他人的虚假信息异常脆弱。这表明欺骗技能的扩张速度可能快于检测能力。总体而言,The Traitors 提供了一个聚焦、可配置的 testbed,用于探讨 LLM 在社交细微互动中的行为。我们将本工作定位为更严谨研究欺骗机制、对齐挑战以及 AI 系统更广泛社交可靠性的贡献。
引用
@article{arxiv.2505.12923,
title = {The Traitors: Deception and Trust in Multi-Agent Language Model Simulations},
author = {Pedro M. P. Curvo},
journal= {arXiv preprint arXiv:2505.12923},
year = {2025}
}
备注
9 main pages, 31 pages