中文

Among Them:面向评估大语言模型说服能力的游戏化框架

计算与语言 2025-07-01 v1 人工智能 计算机与社会 多智能体系统

摘要

大语言模型(LLM)和自主 AI 代理的广泛普及引发了人们对自动化说服和社会影响的担忧。尽管现有研究已探讨了基于 LLM 的操控行为的孤立实例,但针对不同模型说服能力的系统性评估仍然有限。本文提出了一种受《Among Us》游戏启发的框架,用于在受控环境中评估 LLM 的欺骗能力。该框架使得可以通过游戏统计数据比较 LLM 模型,并根据社会心理学和修辞学中的 25 种说服策略量化游戏中的操控行为。在 8 个不同类型和规模的流行语言模型上进行的实验表明,所有被测试模型均表现出说服能力,成功运用了 25 种预期技巧中的 22 种。我们还发现,更大的模型并未比小模型提供任何说服优势,且更长的模型输出与获胜游戏数量呈负相关。本研究为理解 LLM 的欺骗能力提供了见解,并为该领域的未来研究提供了工具和数据。

关键词

引用

@article{arxiv.2502.20426,
  title  = {Among Them: A game-based framework for assessing persuasion capabilities of LLMs},
  author = {Mateusz Idziejczak and Vasyl Korzavatykh and Mateusz Stawicki and Andrii Chmutov and Marcin Korcz and Iwo Błądek and Dariusz Brzezinski},
  journal= {arXiv preprint arXiv:2502.20426},
  year   = {2025}
}