中文

通过理论心之眼:多模态视频大语言模型读心术

计算机视觉与模式识别 2025-09-16 v2 人工智能

摘要

大型多模态模型是否具有类似人类的情感和社交推理能力,以及这种能力如何发挥作用?近期研究发现,大型语言模型(LLM)在大型语言模型中展现出涌现的理论心(ToM)推理能力。LLM能够通过解决各种关于演员ToM(例如,人类信念、欲望、意图)的文本ToM任务来推理人类的心理状态。然而,人类的推理往往基于时间上的动态场景。因此,我们考虑视频作为检验时空ToM推理能力的新媒介。具体而言,我们提出了关于包含丰富社交和情感推理内容的视频的显式探测性问题。我们开发了用于ToM推理的多模态LLM管道,使用视频和文本。我们通过检索关键帧来实现对ToM问题的显式推理,从而揭示了多模态LLM如何推理ToM。

关键词

引用

@article{arxiv.2406.13763,
  title  = {Through the Theory of Mind's Eye: Reading Minds with Multimodal Video Large Language Models},
  author = {Zhawnen Chen and Tianchun Wang and Yizhou Wang and Michal Kosinski and Xiang Zhang and Yun Fu and Sheng Li},
  journal= {arXiv preprint arXiv:2406.13763},
  year   = {2025}
}