中文

因果关系至关重要:时间信息如何在视频语言模型中涌现

计算机视觉与模式识别 2025-11-18 v2

摘要

视频语言模型(VideoLM)在多模态理解方面取得了显著进展。然而,时间理解,即识别事件顺序、持续时间和跨时间关系,仍然是一个核心挑战。先前的工作强调位置编码(PE)是编码时间结构的关键机制。令人惊讶的是,我们发现移除或修改视频输入中的PE对时间理解性能的影响微乎其微。相比之下,在保留原始PE的同时反转帧序列会导致性能大幅下降。为了解释这种行为,我们进行了大量的分析实验,以追踪时间信息如何在模型内整合。我们发现了一条因果信息通路:时间线索通过帧间注意力逐步合成,在最后一帧中聚合,随后整合到查询令牌中。这种涌现机制表明,时间推理源于因果注意力约束下的视觉令牌间交互,这隐式地编码了时间结构。基于这些见解,我们提出了两种面向效率的策略:分阶段跨模态注意力和用于早期令牌截断的时间退出机制。在两个基准上的实验验证了这两种方法的有效性。据我们所知,这是对VideoLM中视频时间理解的首次系统研究,为未来模型改进提供了见解。我们的代码可在 https://github.com/ANDgate99/Causality-Matters 获取。

关键词

引用

@article{arxiv.2508.11576,
  title  = {Causality Matters: How Temporal Information Emerges in Video Language Models},
  author = {Yumeng Shi and Quanyu Long and Yin Wu and Wenya Wang},
  journal= {arXiv preprint arXiv:2508.11576},
  year   = {2025}
}

备注

Accepted to AAAI 2026