VideoTG-R1:基于反射边界标注的课程强化学习提升视频时序定位
计算机视觉与模式识别
2025-10-28 v1
摘要
视频时序定位(VTG)旨在根据语言查询在视频中定位精确片段,这是视频理解中的一个基本挑战。虽然最近的多模态大语言模型(MLLMs)通过强化学习(RL)在解决VTG方面显示出前景,但它们忽略了训练样本质量和难度所带来的挑战。(1)部分标注样本。许多样本包含标注区间之外的相关片段,引入了模糊的监督。(2)难以定位的样本。表现差的样本在RL训练期间产生持续的低且难以区分的奖励,表现出对多个输出之间没有明确偏好,从而阻碍学习效率。为解决这些挑战,我们提出VideoTG-R1,一种具有反射边界标注的课程RL框架,实现数据高效训练。具体而言,我们提出了边界反射代理(Boundary Reflection Agent),利用MLLMs预测标注区间之外与查询相关的时间戳,从而识别并过滤部分标注样本,减少歧义。此外,我们引入难度估计代理(Difficulty Estimation Agent)来评估每个样本的训练难度,并设计课程RL策略,根据训练步骤动态屏蔽难以定位样本的视频,以缓解训练难度并提供更清晰的偏好。在VTG和基于定位的视频问答任务上的实验表明,我们方法的有效性。显著的是,仅使用10%的训练样本和21%的计算预算,VideoTG-R1在组相对策略优化(GRPO)和监督微调(SFT)下均优于全数据方法。代码可在 https://github.com/ldong1111/VideoTG-R1 获取。
引用
@article{arxiv.2510.23397,
title = {VideoTG-R1: Boosting Video Temporal Grounding via Curriculum Reinforcement Learning on Reflected Boundary Annotations},
author = {Lu Dong and Haiyu Zhang and Han Lin and Ziang Yan and Xiangyu Zeng and Hongjie Zhang and Yifei Huang and Yi Wang and Zhen-Hua Ling and Limin Wang and Yali Wang},
journal= {arXiv preprint arXiv:2510.23397},
year = {2025}
}