中文

MultiMind: 通过多模态推理与理论心智模型增强狼人猎手智能体

人工智能 2025-09-16 v4

摘要

大型语言模型(LLM)智能体在社交推理游戏(SDGs)中展现出惊人的能力,如狼人游戏,其中需要战略推理和社交欺骗。然而,现有方法仅限于文本信息,忽略了面部表情和语调等多模态线索,这些线索是人类天然用来交流的方式。此外,现有的SDG智能体主要关注推断其他玩家身份,而不建模其他玩家如何感知自己或其他玩家。为此,我们采用One Night Ultimate Werewolf(ONUW)作为测试平台,提出MultiMind——首个将多模态信息整合到SDG智能体中的框架。MultiMind处理面部表情和语调以处理口头内容,同时采用理论心智(ToM)模型表示每个玩家对其他玩家的怀疑水平。通过将ToM模型与蒙特卡洛树搜索(MCTS)结合,我们的智能体识别最小化自身受怀疑的沟通策略。通过在智能体对抗模拟和人类玩家研究中进行全面评估,我们证明MultiMind在游戏中的表现优于现有方法。我们的工作代表了向具备类人社交推理能力的LLM智能体迈出的重要一步,跨越多模态领域。

关键词

引用

@article{arxiv.2504.18039,
  title  = {MultiMind: Enhancing Werewolf Agents with Multimodal Reasoning and Theory of Mind},
  author = {Zheng Zhang and Nuoqian Xiao and Qi Chai and Deheng Ye and Hao Wang},
  journal= {arXiv preprint arXiv:2504.18039},
  year   = {2025}
}

备注

Accepted by ACMMM 2025