LLM-Hanabi:基于 Theory-of-Mind 与推理路径评估非完美信息合作游戏中的多智能体游戏play
人工智能
2025-10-07 v1 计算与语言
摘要
有效的多智能体协作需要智能体推断他人行动背后的理由,这一能力根植于心智理论(Theory-of-Mind, ToM)。虽然最近的大语言模型(LLMs)在逻辑推理方面表现出色,但其在动态、协作环境中推断理由的能力仍未得到充分探索。本研究引入 LLM-Hanabi,一个新颖的基准测试,利用合作游戏 Hanabi 评估大语言模型的理由推理与心智理论能力。我们的框架具备自动化评估系统,衡量游戏表现与心智理论水平。我们发现,心智理论与游戏成功之间存在显著的正相关。值得注意的是,一阶心智理论(解释他人意图)与表现的关联性更强于二阶心智理论(预测他人解读)。这些发现表明,对于有效的 AI 协作,准确理解合作伙伴的理由解释能力比更高阶的推理更为关键。我们得出结论,优先考虑一阶心智理论是提升未来模型协作能力的有前景的方向。
引用
@article{arxiv.2510.04980,
title = {LLM-Hanabi: Evaluating Multi-Agent Gameplays with Theory-of-Mind and Rationale Inference in Imperfect Information Collaboration Game},
author = {Fangzhou Liang and Tianshi Zheng and Chunkit Chan and Yauwai Yim and Yangqiu Song},
journal= {arXiv preprint arXiv:2510.04980},
year = {2025}
}
备注
EMNLP 2025 Wordplay