Video-Only ToM: 增强多模态大语言模型的理论心智能力
计算机视觉与模式识别
2026-03-26 v1
摘要
随着大语言模型(LLM)不断进步,越来越多的人们关注其推断人类心理状态并展现类人理论心智(ToM)的能力。然而,大多数现有的ToM评估都集中在基于文本的输入上,而仅依赖视觉信息的情景受到很少关注。这留下了一个缺口,因为现实中的人机交互通常需要多模态理解。此外,许多当前方法将模型视为黑箱,很少探究其内部注意力在多选问答(QA)中的行为。来自LLM幻觉对此类任务的影响也在可解释性角度下受到不足的探讨。为此,我们引入VisionToM,一个面向视觉的干预框架,旨在强化任务感知的推理。核心思想是计算干预向量,将视觉表征与正确语义目标对齐,从而通过视觉特征的不同层次引导模型的注意力。这种指导减少了模型对虚假语言先验的依赖,导致更可靠的多模态语言模型(MLLM)输出和更好的QA性能。在EgoToM基准测试上的实验——这是一套用于ToM的以自我中心视角为导向的真实世界视频数据集,包含三个多选QA设置——显示出我们的 метод在显著性地提升了MLLM的ToM能力。此外,在额外的开放式生成任务上也显示出VisionToM使MLLM能够产生更准确地捕捉行为者心理状态的自由形式解释,将机器与人类的协作推向更大的对齐。
引用
@article{arxiv.2603.24484,
title = {Video-Only ToM: Enhancing Theory of Mind in Multimodal Large Language Models},
author = {Siqi Liu and Xinyang Li and Bochao Zou and Junbao Zhuo and Huimin Ma and Jiansheng Chen},
journal= {arXiv preprint arXiv:2603.24484},
year = {2026}
}
备注
20 pages, 7 figures, accepted at CVPR 2026, project page: see https://founce.github.io/VisionToM