基于自验证强化学习的 TimeSearch-R:长形式视频理解的自适应时空搜索
摘要
时空搜索旨在从数万个候选帧中识别出与给定查询相关的最小帧集,为准确的长形式视频理解提供基础。现有方法通常试图逐步缩小搜索空间,但这些方法通常依赖手工设计的搜索流程,缺乏针对学习最优搜索策略的端到端优化。在本文中,我们提出 TimeSearch-R,将时空搜索重新表述为交错的文本-视频思考,无缝地通过强化学习(RL)将视频剪辑搜索集成到推理过程中。然而,将诸如 Group Relative Policy Optimization(GRPO)等 RL 训练方法应用于视频推理会导致中间搜索决策缺乏监督,从而导致对视频内容的探索不足和逻辑推理不一致。为解决此问题,我们引入了带完整性自验证的 GRPO(GRPO-CSV),该方法从交错推理过程中收集已搜索的视频帧,并利用相同的策略模型验证已搜索帧的充分性,从而提高视频推理的完整性。此外,我们构建了专为 GRPO-CSV 的 SFT 冷启动和 RL 训练设计的数据集,筛选出时序依赖性较弱的样本,以提高任务难度并提升时空搜索能力。广泛的实验表明,TimeSearch-R 在时空搜索基准测试如 Haystack-LVBench 和 Haystack-Ego4D 上取得显著提升,以及长形式视频理解基准测试如 VideoMME 和 MLVU 上也表现出色。值得注意的是,TimeSearch-R 在 LongVideoBench 上取得了相对于基础模型 Qwen2.5-VL 的 4.1% 的提升,以及相对于先进视频推理模型 Video-R1 的 2.0% 的提升。我们的代码已公开于 https://github.com/Time-Search/TimeSearch-R。
引用
@article{arxiv.2511.05489,
title = {TimeSearch-R: Adaptive Temporal Search for Long-Form Video Understanding via Self-Verification Reinforcement Learning},
author = {Junwen Pan and Qizhe Zhang and Rui Zhang and Ming Lu and Xin Wan and Yuan Zhang and Chang Liu and Qi She},
journal= {arXiv preprint arXiv:2511.05489},
year = {2025}
}
备注
22 pages, 17 figures. Official code: https://github.com/Time-Search/TimeSearch-R