基于协同多智能体脚本生成的 Murder Mystery 游戏中不完美信息推理提升
人工智能
2026-04-14 v1
摘要
视觉语言模型 (VLM) 在感知任务中展现出惊人的能力,但在多玩家游戏场景下的复杂多跳推理中性能下降,尤其是在信息不完美且具欺骗性时。本文研究了一个典型的多玩家任务——Murder Mystery 游戏,该任务需要根据由不同意图角色提供的部分线索推断隐藏真相。为解决这一挑战,我们提出了一种用于评估和合成高质量、以角色为导向的多人游戏脚本的协同多智能体框架,使其能够针对角色身份(即凶手与无辜者)生成细粒度的互动模式。我们的系统通过协调的智能体交互生成丰富的多模态上下文,包括角色背景故事、视觉与文本线索以及多跳推理链。我们设计了两阶段的智能体监控训练策略以提升 VLM 的推理能力:(1) 基于链式思维的微调,使用精心挑选和合成的数据集建模不确定性与欺骗;(2) 基于 GRPO 的强化学习,采用智能体监控的奖励塑造,鼓励模型发展角色特定的推理行为和有效的多模态多跳推理。大量实验表明,我们的方法显著提升了 VLM 在叙事推理、隐藏事实提取和抗欺骗理解方面的性能。我们的贡献为在不确定、对抗且社交复杂条件下训练和评估 VLM 提供了可扩展的解决方案,为未来在不完美信息下的多模态多跳推理基准奠定了基础。
引用
@article{arxiv.2604.11741,
title = {Collaborative Multi-Agent Scripts Generation for Enhancing Imperfect-Information Reasoning in Murder Mystery Games},
author = {Keyang Zhong and Junlin Xie and Hefeng Wu and Haofeng Li and Guanbin Li},
journal= {arXiv preprint arXiv:2604.11741},
year = {2026}
}
备注
9 pages, 5 figures, Findings of ACL 2026