中文

DATE:长视频理解中的动态绝对时间增强

计算机视觉与模式识别 2025-09-12 v1

摘要

长视频理解是多模态大语言模型(MLLMs)面临的基本挑战,尤其是在需要精确时序推理和事件定位的任务中。现有方法通常采用均匀帧采样并依赖隐式位置编码来建模时序顺序,但这些方法在处理长程依赖时存在严重问题,导致关键信息丢失并降低时序理解能力。本文提出了动态绝对时间增强(DATE)方法,通过时间戳注入机制(TIM)和语义引导的时间感知相似性采样策略(TASS)来增强 MLLMs 的时序意识。具体而言,我们将视频帧嵌入与文本时间戳标记交错,从而构建连续时序参考系统。我们进一步将视频采样问题重新表述为视觉-语言检索任务,引入两阶段算法以确保语义相关性和时序覆盖:将每个查询丰富为描述性标题以更好地与视觉特征对齐,并采用基于相似性的时序正则化贪婪策略对关键事件进行采样。我们的方法在绝对时间理解和关键事件定位方面实现了显著提升,在小时级视频基准测试中取得了 7B 和 72B 模型的SOTA性能。尤其是,我们的 7B 模型在某些基准测试中甚至超过了许多 72B 模型。

关键词

引用

@article{arxiv.2509.09263,
  title  = {DATE: Dynamic Absolute Time Enhancement for Long Video Understanding},
  author = {Chao Yuan and Yang Yang and Yehui Yang and Zach Cheng},
  journal= {arXiv preprint arXiv:2509.09263},
  year   = {2025}
}