中文

SoMi-ToM:评估具象社交互动中的多视角心智推理

计算与语言 2025-12-16 v3 人工智能 计算机视觉与模式识别 机器人学

摘要

人类通过感知他人在动态真实社交互动中所处的环境,持续推断他人的状态、目标和行为。然而,大多数心智推理(ToM)基准仅评估静态文本场景,与真实互动之间存在显著差距。我们提出了 SoMi-ToM 基准,旨在评估具象多智能体复杂社交互动中的多视角心智推理。该基准基于由交互环境 SoMi 生成的丰富多模态互动数据而构建,涵盖多样化的 crafting 目标和社交关系。我们的框架支持多层次评估:(1)第一人称评估在任务进行中提供来自第一人称视角的多模态(视觉、对话、动作等)输入,用于实时状态推理;(2)第三人称评估在任务完成后提供完整的第三人称视角视频和文本记录,用于目标和行为推理。这种评估方法允许更全面地从主观的即时体验和客观的全局观察两个角度检验模型的心智推理能力。我们构建了一个具有挑战性的数据集,包含 35 个第三人称视角视频、363 个第一人称视角图像和 1225 个专家标注的多选问题(每个问题有三个选项)。在该数据集上,我们系统评估了人类主体和几个最先进的大型视觉语言模型(LVLMs)的性能。结果表明,LVLMs 在 SoMi-ToM 上的表现显著低于人类:在第一人称评估中,人类与模型之间的平均准确率差距为 40.1%,在第三人称评估中为 26.4%。这表明未来的 LVLMs 需要进一步提升其在具象、复杂社交互动中的心智推理能力。

关键词

引用

@article{arxiv.2506.23046,
  title  = {SoMi-ToM: Evaluating Multi-Perspective Theory of Mind in Embodied Social Interactions},
  author = {Xianzhe Fan and Xuhui Zhou and Chuanyang Jin and Kolby Nottingham and Hao Zhu and Maarten Sap},
  journal= {arXiv preprint arXiv:2506.23046},
  year   = {2025}
}

备注

24 pages, 6 figures