Time-R1:基于强化学习的后训练大型视觉语言模型用于时序视频定位
计算机视觉与模式识别
2025-07-01 v3 人工智能
计算与语言
摘要
时序视频定位(TVG)是基于语言查询定位特定视频片段的任务,是长篇视频理解的核心挑战。虽然最近的大型视觉语言模型(LVLMs)通过监督微调(SFT)在解决TVG方面显示出初步希望,但其泛化能力仍有限。为此,我们提出一种新颖的后训练框架,通过强化学习(RL)增强LVLMs的泛化能力。具体而言,我们的贡献包括三个关键方向:(1)Time-R1:我们引入一种通过RL进行推理引导的后训练框架,利用可验证奖励来增强LVLMs在TVG任务上的能力。(2)TimeRFT:我们在精选的RL友好数据集上探索数据高效后训练策略,使模型能够逐渐理解困难样本,从而实现更好的泛化。(3)TVGBench:我们仔细构建了一个小而全面的基准测试,用于LVLMs评估,涵盖11种查询类型,并在视频和查询之间保持平衡分布。广泛的实验表明,Time-R1仅使用2.5K训练数据即可在多个下游数据集上实现最先进性能,同时提升了其通用视频理解能力。
引用
@article{arxiv.2503.13377,
title = {Time-R1: Post-Training Large Vision Language Model for Temporal Video Grounding},
author = {Ye Wang and Ziheng Wang and Boshen Xu and Yang Du and Kejun Lin and Zihan Xiao and Zihao Yue and Jianzhong Ju and Liang Zhang and Dingyi Yang and Xiangnan Fang and Zewen He and Zhenbo Luo and Wenxuan Wang and Junqi Lin and Jian Luan and Qin Jin},
journal= {arXiv preprint arXiv:2503.13377},
year = {2025}
}
备注
Project Page: https://xuboshen.github.io/Time-R1/