中文

MOMENTS:面向理论心智 (Theory of Mind) 的综合多模态基准

计算与语言 2025-09-23 v2

摘要

理解理论心智 (ToM) 对构建具备社交智能的多模态智能体至关重要,这些智能体能够感知和解释人类行为。我们引入 MoMentS (Multimodal Mental States),一个综合性基准,旨在通过呈现于短片中的真实、叙事丰富的情景,评估多模态大语言模型 (LLM) 的 ToM 能力。MoMentS 包含超过 2,300 个多选问题,涵盖七个不同的 ToM 类别。该基准包含长视频上下文窗口和真实的社交互动,提供深入洞察人物心理状态。我们评估了多个 MLLM,发现虽然视觉通常会提升性能,但模型仍难以有效整合。对于音频,仅将对话作为音频处理的模型并不一定优于基于转录的输入。我们的发现凸显了多模态整合的必要性,并指出了必须解决的开放性挑战,以推动 AI 的社交理解能力。

关键词

引用

@article{arxiv.2507.04415,
  title  = {MOMENTS: A Comprehensive Multimodal Benchmark for Theory of Mind},
  author = {Emilio Villa-Cueva and S M Masrur Ahmed and Rendi Chevi and Jan Christian Blaise Cruz and Kareem Elzeky and Fermin Cristobal and Alham Fikri Aji and Skyler Wang and Rada Mihalcea and Thamar Solorio},
  journal= {arXiv preprint arXiv:2507.04415},
  year   = {2025}
}