合作推理的火花:LLM 作为战略性 Hanabi 智能体
计算与语言
2026-03-17 v2
摘要
不完全信息下的合作推理对人类和多智能体系统而言仍具挑战。纸牌游戏 Hanabi 体现了这一挑战,需要心智理论推理和策略性沟通。我们在 2-5 人游戏中对 17 个 SOTA LLM 智能体进行基准测试,并研究上下文工程在不同模型规模(4B 至 600B+)间的影响,以理解持续的协调失败和对脚手架的鲁棒性:从仅包含明确纸牌细节的最小提示,到基于贝叶斯动机的程序化推导脚手架,再到通过工作记忆进行多轮状态跟踪。我们表明,(1)智能体能够维持内部工作记忆以进行状态跟踪,(2)不同 LLM 之间的交叉对弈性能随模型强度平滑插值。在 Sherlock 设置下,最强的推理模型在不同玩家数量下平均得分超过 15 分,但仍落后于经验丰富的人类和专门的 Hanabi 智能体,后两者得分始终在 20 分以上。我们发布了首批带有标注轨迹和动作效用的公开 Hanabi 数据集:(1)HanabiLogs,包含 1,520 条用于指令微调的完整游戏日志;(2)HanabiRewards,包含 560 局带有所有候选动作密集动作级价值标注的游戏。在我们的数据集上对 4B 开源权重模型进行监督和 RL 微调,分别使合作 Hanabi 游戏性能提升了 21% 和 156%,使其性能达到与强大的专有推理模型相差约 3 分以内,并超越最佳非推理模型 52%。经 HanabiRewards RL 微调的模型进一步泛化到 Hanabi 之外,在合作群体猜测基准上提升 11%,在 EventQA 上的时序推理提升 6.4%,在 IFBench-800K 上的指令遵循提升 1.7 Pass@10,并匹配 AIME 2025 数学推理 Pass@10。
引用
@article{arxiv.2601.18077,
title = {Sparks of Cooperative Reasoning: LLMs as Strategic Hanabi Agents},
author = {Mahesh Ramesh and Kaousheik Jayakumar and Aswinkumar Ramkumar and Pavan Thodima and Aniket Rege and Emmanouil-Vasileios Vlatakis-Gkaragkounis},
journal= {arXiv preprint arXiv:2601.18077},
year = {2026}
}