中文

TempSamp-R1:基于强化微调的时间抽样方法用于视频大语言模型

计算机视觉与模式识别 2025-09-26 v2

摘要

本文提出了TempSamp-R1,一种新的强化微调框架,旨在提高多模态大语言模型(MLLM)适用于视频时间定位任务的效果。我们揭示了现有强化学习方法(如群体相对策略优化,GRPO)依赖于基于策略的抽样进行策略更新。然而,在具有大规模时间搜索空间的任务中,这一策略既高效低下,又在性能上受限,由于往往难以识别出具有时序准确性的解决方案。为解决这一局限性,TempSamp-R1利用ground-truth标注作为离策略监督,提供时序精确的指导,有效弥补基于策略解决方案中稀疏性和误差对齐的问题。为进一步稳定训练并减少基于奖励的更新方差,TempSamp-R1提供一种非线性软优势计算方法,通过非对称变换动态重塑奖励反馈。通过采用混合链式思维(CoT)训练范式,TempSamp-R1优化单个统一模型,以支持CoT和非CoT推理模式,高效处理推理复杂度不同的查询。实验结果表明,TempSamp-R1在Charades-STA([email protected]:52.9%,提升2.7%)、ActivityNet Captions([email protected]:56.0%,提升5.3%)和QVHighlights(mAP:30.0%,提升3.0%)等基准数据集上超越GRPO-based基线,建立了新的最佳性能。此外,TempSamp-R1在数据有限的情况下表现出稳健的few-shot泛化能力。

关键词

引用

@article{arxiv.2509.18056,
  title  = {TempSamp-R1: Effective Temporal Sampling with Reinforcement Fine-Tuning for Video LLMs},
  author = {Yunheng Li and Jing Cheng and Shaoyong Jia and Hangyi Kuang and Shaohui Jiao and Qibin Hou and Ming-Ming Cheng},
  journal= {arXiv preprint arXiv:2509.18056},
  year   = {2025}
}

备注

Accepted at NeurIPS 2025