中文

当发生什么:视频事件时间顺序学习

计算机视觉与模式识别 2025-12-11 v1 人工智能

摘要

视频大模态模型(VLMMs)在视频理解方面展现了惊人的性能,但其准确捕捉多个事件时间顺序的能力仍未得到充分探讨。我们有趣地观察到,即使视频帧被随机排列,模型在现有基准测试上表现良好。这表明 VLMMs 可能并不依赖于对视觉事件的准确序列处理,而是依赖对典型情景的先验知识来回答问题。为评估 VLMMs 在事件时间顺序识别能力,本文提出 VECTOR 框架,旨在明确评估模型识别事件顺序的能力。在该基准测试上,我们发现各种 VLMMs 常常难以理解事件的顺序。为此,我们提出 MECOT(Multi-Event instruction fine-tuning with Chain-of-Thought),其 (1) 在事件级别的视频描述上进行训练, (2) 使用链路思维提示在推理阶段增强时间感知。MECOT 在 VECTOR 及现有视频基准测试上均超越了先前方法,表明其在时间理解方面的有效性。我们将发布代码、模型和数据集。

关键词

引用

@article{arxiv.2512.08979,
  title  = {What Happens When: Learning Temporal Orders of Events in Videos},
  author = {Daechul Ahn and Yura Choi and Hyeonbeom Choi and Seongwon Cho and San Kim and Jonghyun Choi},
  journal= {arXiv preprint arXiv:2512.08979},
  year   = {2025}
}

备注

WACV 2026