中文

TimeSearch:具有聚光灯与反思的分层视频搜索实现类人长视频理解

计算机视觉与模式识别 2025-12-03 v2 人工智能

摘要

大型视频语言模型(LVLM)在各种视频语言任务中表现出色。然而,在处理长视频时,由于涉及大量视频帧,它们面临显著挑战。在空间或时间上对长视频进行下采样可能导致视觉幻觉,从而难以准确解释长视频。受人类分层时间搜索策略的启发,我们提出了\textbf{TimeSearch},一种新颖的框架,使LVLM能够以类人方式理解长视频。TimeSearch将两种类人原语集成到统一的自回归LVLM中:1)\textbf{聚光灯}通过时间增强帧表示(TAFR)高效识别相关时间事件,将视觉特征与时间戳显式绑定;2)\textbf{反思}评估已识别事件的正确性,利用LVLM固有的时间自我反思能力。TimeSearch逐步探索关键事件,并根据反思置信度优先进行时间搜索。在具有挑战性的长视频基准上的大量实验证实,TimeSearch显著超越了先前的最先进技术,在LVBench上将准确率从41.8%提高到51.5%。此外,时间定位实验表明,适当的TAFR足以以更简单且通用的方式有效激发LVLM令人惊讶的时间定位能力,在Charades-STA上将mIoU提高了11.8%。代码将发布。

关键词

引用

@article{arxiv.2504.01407,
  title  = {TimeSearch: Hierarchical Video Search with Spotlight and Reflection for Human-like Long Video Understanding},
  author = {Junwen Pan and Rui Zhang and Xin Wan and Yuan Zhang and Ming Lu and Qi She},
  journal= {arXiv preprint arXiv:2504.01407},
  year   = {2025}
}