无交互动作:通过接触-释放检测探究视频多模态大模型的物理基础
计算机视觉与模式识别
2026-04-10 v2 人工智能
神经元与认知
摘要
大型多模态模型(LMM)在图像和近期更广泛地用于视频的真实视觉任务中显示出日益提升的性能。例如,给定视频序列,这些模型能够详细描述物体、周围环境和动态动作。在本研究中,我们探讨了这些模型其语义理解是否真正依赖于实际的视觉输入。具体而言,我们考察了模型何时何处识别手部与物体之间的交互开始或结束。为此,我们引入了一个首次提出的大型数据集,包含超过2万个在Something-Something-V2数据集视频上标注的交互事件。250名AMTurk人类标注员标记了核心交互事件,特别是标注物体和主体何时何处发生“接触”或“释放”。我们要求最先进的LMM(包括GPT、Gemini和Qwen)在短视频中定位这些事件(每个视频仅含一个事件)。结果表明,尽管模型可靠地命名目标物体并识别动作,但它们表现出一种“捷径学习”现象,即语义成功掩盖了物理 grounding 的失败。具体而言,模型一致性地未能识别交互开始或结束的帧,并在场景中错误地局部化物理事件。这一离散现象表明,尽管LMM在系统1直觉模式识别方面表现出色(命名动作和物体),但它们缺乏推理物理基本单元如“接触”和“释放”所必需的系统2认知基础,从而未能真正将动态场景 grounding 在物理现实中。
引用
@article{arxiv.2511.20162,
title = {Action Without Interaction: Probing the Physical Foundations of Video LMMs via Contact-Release Detection},
author = {Daniel Harari and Michael Sidorov and Chen Shterental and Liel David and Abrham Kahsay Gebreselasie and Muhammad Haris Khan},
journal= {arXiv preprint arXiv:2511.20162},
year = {2026}
}