中文

Decrypto 基准:多智能体推理与心智理论

人工智能 2025-06-26 v1 计算与语言 人机交互 多智能体系统

摘要

随着大语言模型(LLM)具备智能体能力,它们将需要在复杂的多智能体场景中与人类用户及其他智能体进行交互,在合作与竞争的环境中协作。这需要新的推理技能,其中最重要的便是心智理论(ToM),即推理其他智能体“心智”状态的能力。然而,ToM 及其他多智能体能力在 LLM 中的表现尚不为人所了解,因为现有基准测试受限于范围狭窄、数据泄漏、饱和,以及缺乏交互性。我们因此提出 Decrypto,一种基于游戏的多智能体推理与 ToM 基准,灵感来自认知科学、计算语用学和多智能体强化学习。它旨在在除其他所有维度外尽可能简化,消除其他基准测试中常见的混杂因素。据我们了解,这也是第一个用于设计交互式 ToM 实验的平台。通过对前沿 LLM 的全面经验评估、鲁棒性研究以及人类- AI 交互实验,我们验证了基准设计。我们发现 LLM 的游戏-playing 能力落后于人类且不如简单的词嵌入基线。随后我们在 Decrypto 中构建了两种经典认知科学实验的变体,以评估三个关键 ToM 能力。令人惊讶的是,我们发现最先进的推理模型在这些任务上的表现显著差于较旧模型。这表明 Decrypto 解决了当前推理和 ToM 评估中的关键缺口,为更好的人工智能代理铺平了道路。

关键词

引用

@article{arxiv.2506.20664,
  title  = {The Decrypto Benchmark for Multi-Agent Reasoning and Theory of Mind},
  author = {Andrei Lupu and Timon Willi and Jakob Foerster},
  journal= {arXiv preprint arXiv:2506.20664},
  year   = {2025}
}

备注

41 pages, 19 figures