MINDGAMES:用于评估多智能体 LLM 社交与战略推理的在线竞技场
人工智能
2026-05-29 v1
摘要
大型语言模型(LLM)日益被用作交互式智能体,但其在持续交互环境中的社交与战略推理能力仍鲜有了解。现有评估依赖静态情景或单游戏基准,无法捕捉真实世界多智能体环境所需的持续性、多维度推理。我们引入了 Mindgames,这是一个多游戏竞技场和评估平台,用于 LLM 智能体, operationalizes 贴合“心智理论”所需的互补推理需求:在隐藏信息下的信念归因、通过持续战略互动的对手建模、在知识不对称下的合作推理、以及社交推理中的持久欺骗。基于 TextArena 构建,Mindgames 提供统一的交互接口、TrueSkill 评级制度以及完整的轨迹记录,覆盖四个游戏环境:Colonel Blotto、Iterated Prisoner's Dilemma、Codenames 和 Secret Mafia。我们通过在主要 AI conference 举办的 2025 年 competition cycle 实现了 Mindgames,这一周期评估了 944 个来自 76 个团队提交的智能体,涉及四个游戏。我们的分析揭示了 agent 层面和评估层面的局限性:规则遵循的脆弱性仍是一个主要瓶颈,顶级系统反复依赖显式的结构支架,而排行榜的有效性在不同环境之间差异显著。特别是,在高失败率的环境中,稳健性对对手错误的适应性往往与战略能力一样能获得好成绩,Secret Mafia 在本周期内显示出明显的错误生存混淆。我们发布了一个包含 29,571 场多智能体游戏的数据集,包含逐轮观察、动作和奖励,另外还有 MG-Ref,这是一套确定性离线锦标赛协议,对新提交的智能体在相同的错误归因视角下对抗一组被冻结的顶级低错误 Stage II 提交者进行评分。
引用
@article{arxiv.2605.29512,
title = {MINDGAMES: A Live Arena for Evaluating Social and Strategic Reasoning in Multi-Agent LLMs},
author = {Kevin Wang and Anna Thöni and Benjamin Kempinski and Bobby Cheng and Jianzhu Yao and Benjamin Finch and Leon Guertler and Viraj Nadkarni and Yihan Jiang and Aliaksei Korshuk and Alexander Buyantuev and Ilya Makarov and Siyuan Wu and Yu-Chi Cheng and Yan-Ru Ju and Ti-Rong Wu and I-Hsuan Chu and Yu-Yu Yang and I-Chen Wu and Yitian Huang and Qinlu Cao and Yiheng Sun and Yuhong Dai and Hongkun Yao and Jingxuan Fu and Jiwei Zhang and Hao Liao and Mossimo Ebeling and Govind Arun and Sadhvik Bathini and Mihir S Arya and Avinash Anish and Aditya Ranjan and Kirtana Sunil Phatnani and Paval KS and Vrushali Mehta and Aravind S and Nikhil Arora and Tanya Upadhyay and Amol Bandagale and Yuan Lu and ChunEn Hsiao and YuTing Lin and Arvin Chung and Jerry John Thomas and Mathieu Laurière and Leshem Choshen and Yoram Bachrach and Pramod Viswanath and Maria Polukarov and Cheston Tan and Tal Kachman and Atlas Wang},
journal= {arXiv preprint arXiv:2605.29512},
year = {2026}
}