中文

Video-OPD:基于策略蒙特卡洛树搜索的多模态大语言模型时序视频定位后训练方法

计算机视觉与模式识别 2026-05-15 v2

摘要

强化学习因其基于策略的优化而成为时序视频定位(TVG)的首选后训练范式,但现有的GRPO-based方法仍受限于稀疏奖励信号和巨大的计算开销。我们提出Video-OPD,一个受最新基于策略蒙特卡洛树搜索技术启发的TVG高效后训练框架。Video-OPD优化直接从当前策略采样的轨迹,从而保持训练与推断分布之间的一致性,而一个锦囊教师通过逆KL散度目标提供稠密的token级监督。这种表述保留了关键于缓解分布迁移的基于策略特性,同时将稀疏的episode级反馈转换为细粒度的step级学习信号。在Video-OPD的基础上,我们引入Teacher-Validated Disagreement Focusing(TVDF),一种轻量级训练课程,迭代地优先考虑那些既可靠又对学生最具信息性的轨迹,从而提高训练效率。实验结果表明,Video-OPD在 consistently优于GRPO的同时,实现了显著更快的收敛速度和更低的计算成本,确立了基于策略蒙特卡洛树搜索作为TVG常规强化学习的有效替代方案。

关键词

引用

@article{arxiv.2602.02994,
  title  = {Video-OPD: Efficient Post-Training of Multimodal Large Language Models for Temporal Video Grounding via On-Policy Distillation},
  author = {Jiaze Li and Hao Yin and Haoran Xu and Boshen Xu and Wenhui Tan and Zewen He and Jianzhong Ju and Zhenbo Luo and Jian Luan},
  journal= {arXiv preprint arXiv:2602.02994},
  year   = {2026}
}