VideoRFT:通过强化微调激励MLLMs的视频推理能力
计算机视觉与模式识别
2025-10-15 v4
摘要
强化微调(RFT)在实现大语言模型(LLM)人类水平推理能力方面显示出巨大前景,此概念最近已扩展到MLLMs。然而,针对视频进行推理——这是人类智慧的基本方面——仍然是一个持久的挑战,由于视频数据中固有的复杂逻辑、时序和因果结构。为填补这一空白,我们提出VideoRFT,一种新方法,将RFT范式扩展到培育MLLMs的人类式视频推理能力。VideoRFT遵循RFT中标准的两阶段方案:使用链律(CoT)注释进行监督式微调(SFT),随后进行强化学习(RL)以提高泛化能力。要实现这一点在视频领域的关键挑战在于稀缺的大规模高质量视频CoT数据集。我们通过多专家驱动、基于认知的CoT策划管道来解决这一问题。首先,我们设计一种基于认知的提示策略,以从视频内容的丰富、结构化和字面表示出发,引导推理LLM生成初步CoT。随后,这些CoT由基于实际视频的MLLM修订,以确保视觉一致性并减少视觉幻觉。该管道产生两个新数据集,即VideoRFT-CoT-102K用于SFT,VideoRFT-RL-310K用于RL。为进一步强化RL阶段,我们引入一种新型语义一致性奖励,显式促进文本推理与视觉证据之间的对齐。该奖励鼓励模型产生基于视觉输入的连贯、情境感知的推理输出。广泛的实验表明,VideoRFT在六个视频推理基准测试中实现了最先进的性能。
引用
@article{arxiv.2505.12434,
title = {VideoRFT: Incentivizing Video Reasoning Capability in MLLMs via Reinforced Fine-Tuning},
author = {Qi Wang and Yanrui Yu and Ye Yuan and Rui Mao and Tianfei Zhou},
journal= {arXiv preprint arXiv:2505.12434},
year = {2025}
}
备注
Accepted by NeurIPS 2025. Code: https://github.com/QiWang98/VideoRFT