T*: 重新思考长时段视频理解的时序搜索
计算机视觉与模式识别
2025-08-26 v3
摘要
高效理解长时段视频仍是计算机视觉中的重要挑战。本文重新审视长时段视频理解的时序搜索范式,解决了所有最新 (SOTA) 长上下文视觉语言模型 (VLM) 所面临的根本性问题。我们的贡献有两个方面:首先,我们将时序搜索定义为长视频针灼问题:从数万个候选帧中找出少量(例如 1-5 个)与特定查询相关的帧。基于此表述,我们引入 LV-Haystack,第一个包含 480 小时视频、15,092 个人类标注实例的数据集,用于训练和评估,以提高时序搜索质量和效率。在 LV-Haystack 上的实验结果凸显了时序搜索能力之间的重大研究差距,当前 SOTA 搜索方法在 Longvideobench 数据集子集上仅能实现 2.1% 的时序 F1 分数。接下来,灵感来自图像中的视觉搜索,我们提出一种轻量级时序搜索框架 T*,将高昂的时序搜索重新表述为空间搜索。T* 利用广泛应用于图像中的强大视觉定位技术,引入跨时空维度的自适应放大机制。大量实验表明,将 T* 与现有方法集成可显著提升 SOTA 的长时段视频理解能力。在推理预算为 32 帧的情况下,T* 将 GPT-4o 的性能从 50.5% 提升至 53.1%,将 LLaVA-OneVision-OV-72B 的性能从 56.5% 提升至 62.4%。我们的代码、基准数据集和模型均提供于补充材料中。
引用
@article{arxiv.2504.02259,
title = {T*: Re-thinking Temporal Search for Long-Form Video Understanding},
author = {Jinhui Ye and Zihan Wang and Haosen Sun and Keshigeyan Chandrasegaran and Zane Durante and Cristobal Eyzaguirre and Yonatan Bisk and Juan Carlos Niebles and Ehsan Adeli and Li Fei-Fei and Jiajun Wu and Manling Li},
journal= {arXiv preprint arXiv:2504.02259},
year = {2025}
}
备注
Accepted by CVPR 2025; A real-world long video needle-in-haystack benchmark; long-video QA with human ref frames