中文

仆人游戏中 LLM Agent 行为的恩惠独裁者?

机器学习 2025-11-13 v1 人工智能 计算与语言

摘要

在行为科学中,ultimatum game 等实验旨在评估研究参与者对公平或自身利益的偏好。在仆人游戏中,这是 ultimatum game 的一个简化版本,其中两名玩家中的一位作出单一决策,仆人单方面决定如何在自己和另一方之间分配固定资金总额。尽管最近的研究探索了基于大型语言模型 (LLM) 的 AI 代理在不同人格设定下的行为模式,但我们质疑这些结果的稳健性。特别是,这些研究忽略了系统提示 - 塑造模型行为的底层指令 - 的作用,且未考虑结果对轻微提示变化的敏感性。然而,研究 LLM 高度复杂行为方面的稳健基线至关重要。为克服之前的局限性,我们提出了 LLM Agent 行为研究 (LLM-ABS) 框架,以:(i) 探索不同系统提示如何影响模型行为,(ii) 通过使用中性提示变体获取更可靠的代理偏好见解,以及 (iii) 通过分析 LLM 代理对开放指令的语言特征来更好地理解其行为背后的推理过程。我们发现,代理往往表现出对公平的强烈偏好,以及系统提示对其行为的显著影响。从语言学角度,我们确定模型在表达响应方面存在差异。尽管提示敏感性仍是持久的挑战,但我们提出的框架为 LLM 代理行为研究提供了稳健的基础。我们的代码制品已在 https://github.com/andreaseinwiller/LLM-ABS 上提供。

关键词

引用

@article{arxiv.2511.08721,
  title  = {Benevolent Dictators? On LLM Agent Behavior in Dictator Games},
  author = {Andreas Einwiller and Kanishka Ghosh Dastidar and Artur Romazanov and Annette Hautli-Janisz and Michael Granitzer and Florian Lemmerich},
  journal= {arXiv preprint arXiv:2511.08721},
  year   = {2025}
}

备注

7 pages, 2 figures, v1 init