中文

在大型多模态模型中感知时间箭头

计算机视觉与模式识别 2025-10-27 v2

摘要

时间箭头——塑造物理事件的时间不可逆流动——是视频理解的基础,但对于现代大型多模态模型(LMM)而言仍是一个重大挑战。现有的 LMM 在响应语言查询时难以感知和利用视频中的时间方向性,阻碍了更深层的时间理解。我们首先对现有基准和模型进行了批判性分析,然后引入 ArrowRL,一种基于强化学习(RL)的训练策略,通过鼓励正向和反向视觉帧之间产生发散的视频解释来灌输时间箭头意识。为了严格评估,我们还开发了 AoTBench,一个新的多面基准,用于探测时间上具有挑战性的问题。实验表明 ArrowRL 大大推进了时间感知:它不仅在具有挑战性的 AoTBench 上取得了显著提升,而且在标准视频问答(VQA)基准上也明显提高了性能(峰值准确率分别提升超过 20% 和 10%)。这验证了 ArrowRL 的有效性,并强调了在 LMM 中专门的时间箭头理解的迫切需求。

关键词

引用

@article{arxiv.2506.03340,
  title  = {Seeing the Arrow of Time in Large Multimodal Models},
  author = {Zihui Xue and Mi Luo and Kristen Grauman},
  journal= {arXiv preprint arXiv:2506.03340},
  year   = {2025}
}

备注

Accepted by NeurIPS 2025, Project website: https://vision.cs.utexas.edu/projects/SeeAoT