MultiMind: 通过多模态推理与理论心智模型增强狼人猎手智能体
人工智能
2025-09-16 v4
摘要
大型语言模型(LLM)智能体在社交推理游戏(SDGs)中展现出惊人的能力,如狼人游戏,其中需要战略推理和社交欺骗。然而,现有方法仅限于文本信息,忽略了面部表情和语调等多模态线索,这些线索是人类天然用来交流的方式。此外,现有的SDG智能体主要关注推断其他玩家身份,而不建模其他玩家如何感知自己或其他玩家。为此,我们采用One Night Ultimate Werewolf(ONUW)作为测试平台,提出MultiMind——首个将多模态信息整合到SDG智能体中的框架。MultiMind处理面部表情和语调以处理口头内容,同时采用理论心智(ToM)模型表示每个玩家对其他玩家的怀疑水平。通过将ToM模型与蒙特卡洛树搜索(MCTS)结合,我们的智能体识别最小化自身受怀疑的沟通策略。通过在智能体对抗模拟和人类玩家研究中进行全面评估,我们证明MultiMind在游戏中的表现优于现有方法。我们的工作代表了向具备类人社交推理能力的LLM智能体迈出的重要一步,跨越多模态领域。
引用
@article{arxiv.2504.18039,
title = {MultiMind: Enhancing Werewolf Agents with Multimodal Reasoning and Theory of Mind},
author = {Zheng Zhang and Nuoqian Xiao and Qi Chai and Deheng Ye and Hao Wang},
journal= {arXiv preprint arXiv:2504.18039},
year = {2025}
}
备注
Accepted by ACMMM 2025