VerIPO:通过验证器引导的迭代策略优化培养 Video-LLM 的长推理能力
摘要
将强化学习(RL)应用于视频大语言模型(Video-LLMs)在复杂视频推理方面展现出巨大前景。然而,流行的强化微调(RFT)方法,例如基于结果的 Group Relative Policy Optimization (GRPO),受到数据准备瓶颈(例如噪声或高成本)的限制,并且在长思维链和下游性能的质量上表现出不稳定的提升。为了解决这些局限性,我们提出了 VerIPO,一种验证器引导的迭代策略优化方法,旨在逐步提升视频 LLM 生成深度、长期推理链的能力。核心组件是 Rollout-Aware Verifier,位于 GRPO 和 Direct Preference Optimization (DPO) 训练阶段之间,形成 GRPO-Verifier-DPO 训练循环。该验证器利用小型 LLM 作为评判者来评估 rollout 的推理逻辑,从而能够构建高质量的对比数据,包括反思性和上下文一致的 CoT。这些精选的偏好样本驱动了高效的 DPO 阶段(比 GRPO 快 7 倍),带来了推理链质量的显著提升,尤其是在长度和上下文一致性方面。该训练循环受益于 GRPO 的广阔搜索和 DPO 的针对性优化。实验结果表明:1)与标准 GRPO 变体相比,优化速度显著更快且更有效,产生了更优越的性能;2)我们训练的模型超越了大尺度指令微调 Video-LLM 的直接推理,在多样化的视频推理任务上生成了长且上下文一致的 CoT;3)我们的模型仅经过一次迭代就优于强大的 LMM(例如 Kimi-VL)和长推理模型(例如 Video-R1),突显了其有效性和稳定性。
引用
@article{arxiv.2505.19000,
title = {VerIPO: Cultivating Long Reasoning in Video-LLMs via Verifier-Gudied Iterative Policy Optimization},
author = {Yunxin Li and Xinyu Chen and Zitao Li and Zhenyu Liu and Longyue Wang and Wenhan Luo and Baotian Hu and Min Zhang},
journal= {arXiv preprint arXiv:2505.19000},
year = {2025}
}
备注
19 pages, 9 figures, Project Link: https://github.com/HITsz-TMG/VerIPO