中文

迭代放大:面向长视频理解的时间区间探索

计算机视觉与模式识别 2025-07-08 v1 人工智能

摘要

多模态大语言模型(MLLM)在视频理解任务中表现出强大的性能。然而,由于对时间区间的感知效率低下,它们在处理长视频时仍然存在困难。与能够动态调整时间焦点以定位与查询相关时刻的人类不同,当前的MLLM通常依赖于在视频时间线上进行密集、均匀的采样,导致内存消耗高且存在错过关键信息的风险。为了应对这一挑战,我们引入了时间搜索(Temporal Search, TS),这是一个无需训练的框架,使MLLM能够迭代地探索时间区域以改进长视频理解。TS基于一个关键观察:模型在不同时间区间上的生成置信度与预测准确性高度相关。TS通过两个主要的迭代阶段运行。首先,MLLM提出一个可能包含任务相关信息的时间区间。然后,它从该区间中采样固定数量的帧(无论区间长度如何),并将它们输入模型以产生改进后的响应和置信度分数。TS通过迭代地将注意力转移到更细粒度的时间区间来优化模型的焦点,从而提高其对长视频的理解。此外,收集关键帧级别的描述以促进整个视频中的跨区间感知。为了进一步提高效率,我们引入了TS-BFS,一种基于树的广度优先搜索策略。每个节点代表一个候选区间,并通过两种方法进行扩展:自驱动提议和均匀划分。节点根据置信度和自我评估进行评分,并选择最有希望的节点进行持续探索。

关键词

引用

@article{arxiv.2507.02946,
  title  = {Iterative Zoom-In: Temporal Interval Exploration for Long Video Understanding},
  author = {Chenglin Li and Qianglong Chen and fengtao and Yin Zhang},
  journal= {arXiv preprint arXiv:2507.02946},
  year   = {2025}
}