面向无标签跨域时序 grounding 的不确定性量化 Rollout 策略适配
计算机视觉与模式识别
2025-08-11 v1
摘要
视频时序 grounding(TG)旨在在长视频中定位与自然语言描述(查询)相匹配的视频片段。虽然视觉语言模型(VLM)在整体语义匹配方面有效,但常在细粒度时序定位上感到挑战。最近,Group Relative Policy Optimisation(GRPO)将推理过程重新表述为强化学习任务,实现了细粒度 grounding并取得了强大的领域内性能。然而,GRPO依赖标记数据,在无标签域中不可行。此外,由于视频庞大且昂贵,进行大规模适应引入的延迟和计算开销极高,难以实现实时部署。为克服这两个问题,我们引入一种数据高效的无标签跨域时序 grounding 方法,该方法先在标记的源域上训练模型,然后仅使用目标域中少量无标签视频进行适应。该方法无需目标标注,计算和存储开销足以实时运行。具体而言,我们引入不确定性量化 Rollout 策略适配(URPA)用于无目标标签的视频时序 grounding 中的跨域知识迁移。URPA通过GRPO rollouts 生成多个候选预测,平均后形成伪标签,并从这些 rollouts 的方差中估计置信度。该置信度随后用于加权训练奖励,引导模型聚焦于可靠的监督。在六个跨域设置下的三个数据集实验中显示,URPA仅通过少量无标签目标视频即可获得良好泛化。代码将在论文发表后发布。
引用
@article{arxiv.2508.06317,
title = {Uncertainty-quantified Rollout Policy Adaptation for Unlabelled Cross-domain Temporal Grounding},
author = {Jian Hu and Zixu Cheng and Shaogang Gong and Isabel Guan and Jianye Hao and Jun Wang and Kun Shao},
journal= {arXiv preprint arXiv:2508.06317},
year = {2025}
}