中文

基于强化学习的视频时间 grounding 数据集与配方

计算机视觉与模式识别 2025-07-25 v1 人工智能

摘要

视频时间 grounding (VTG) 旨在给定自然语言查询在视频中局化相关的时间段。尽管近期进展显著,大型视觉语言模型 (LVLMs) 和指令调优方法屈居于已有方法之中,但这些方法常常面临时序 awareness 有限和泛化性差的问题。本文引入一种两阶段训练框架,将监督微调与强化学习 (RL) 集成,以提高 VTG 模型的准确性和鲁棒性。我们的方法首先利用高质量精选的 cold start 数据进行 SFT 初始化,然后通过难度控制 RL 进一步提升时序局化和推理能力。在多个 VTG 基准测试上进行全面实验,表明我们的方法在挑战性和开放域情境下 consistently 优于现有模型。我们对训练策略和数据集 curated 进行深入分析,强调高质量 cold start 数据和难度控制 RL 的重要性。为促进进一步的研究和工业应用,我们将释放所有中间数据集、模型和代码给社区。

关键词

引用

@article{arxiv.2507.18100,
  title  = {Datasets and Recipes for Video Temporal Grounding via Reinforcement Learning},
  author = {Ruizhe Chen and Zhiting Fan and Tianze Luo and Heqing Zou and Zhaopeng Feng and Guiyang Xie and Hansheng Zhang and Zhuochen Wang and Zuozhu Liu and Huaijian Zhang},
  journal= {arXiv preprint arXiv:2507.18100},
  year   = {2025}
}