Tempo-R0:通过高效时间感知强化学习实现时间视频定位的视频多模态大语言模型
计算机视觉与模式识别
2025-07-08 v1 人工智能
摘要
时间视频定位(TVG)要求根据语言查询从视频中精确定位相关的时间片段,一直是视频理解领域中极具挑战性的任务。视频通常比文本或图像包含更大的信息量和冗余度。模型需要对整个视频有全面的理解,才能准确检索与查询相关的片段。因此,我们提出了Tempo-R0:一种通过多模态时间感知强化学习实现时间视频定位任务的视频多模态大语言模型(Video-MLLM)。具体而言,在我们流程的预处理阶段,我们采用基于帧内容变化的自适应注意力分配(SAA)方法,以高效利用MLLM有限的注意力。同时,利用显式时间戳模态对齐(ETA)方法来增强模型感知视频中事件边界的能力。在流程的微调部分,我们创造性地将基于部分无关拒绝的群体相对策略优化(PIR-GRPO)应用于TVG领域,通过不仅接受相关的视频-查询对,还拒绝不相关的对,来促进模型的时间推理。实验表明,我们的方法在原始QVHighlights测试集及其具有更合理真实标注的修正版本上,均比SOTA解决方案取得了约3.5%的显著优势。
引用
@article{arxiv.2507.04702,
title = {Tempo-R0: A Video-MLLM for Temporal Video Grounding through Efficient Temporal Sensing Reinforcement Learning},
author = {Feng Yue and Zhaoxing Zhang and Junming Jiao and Zhengyu Liang and Shiwen Cao and Feifei Zhang and Rong Shen},
journal= {arXiv preprint arXiv:2507.04702},
year = {2025}
}