中文

TAR-TVG:基于时间戳锚约束推理增强时序视频定位

计算机视觉与模式识别 2025-08-12 v1 人工智能

摘要

时序视频定位 (Temporal Video Grounding, TVG) 旨在精确定位与自然语言查询相对应的视频片段,这是长视频理解的关键能力。虽然现有的强化学习方法鼓励模型在预测前生成推理链,但它们无法明确约束推理过程以确保最终时序预测的质量。为解决这一局限,我们提出了基于时间戳锚约束推理的时序视频定位 (TAR-TVG),一种新型框架,在推理过程中引入时间戳锚,以对思考内容进行显式监督。这些锚点作为中间验证点。更重要的是,我们要求每个推理步骤都产生越来越准确的时序估计,从而确保推理过程对最终预测具有实质性贡献。为解决模型中低概率锚点生成问题(例如 Qwen2.5-VL-3B),我们开发了一种高效的自蒸馏训练策略:(1) 初始 GRPO 训练以收集包含多个时间戳锚的 30K 条高质量推理痕迹,(2) 在蒸馏数据上进行监督微调 (SFT),(3) 在 SFT 增强模型上进行最终 GRPO 优化。这个三个阶段的训练策略实现了稳健的锚点生成,同时保持推理质量。实验表明,我们的模型在取得最先进性能的同时,能够产生可解释、可验证的推理链,并实现逐步细化的时序估计。

关键词

引用

@article{arxiv.2508.07683,
  title  = {TAR-TVG: Enhancing VLMs with Timestamp Anchor-Constrained Reasoning for Temporal Video Grounding},
  author = {Chaohong Guo and Xun Mo and Yongwei Nie and Xuemiao Xu and Chao Xu and Fei Yu and Chengjiang Long},
  journal= {arXiv preprint arXiv:2508.07683},
  year   = {2025}
}