SFT还是RL?训练类R1推理大型视觉语言模型的早期研究
计算与语言
2025-04-17 v1
摘要
本工作重访了训练大型视觉语言模型(LVLMs)主导的监督微调(SFT)后强化学习(RL)范式,发现了一个关键问题:SFT会显著损害后续RL的效果,导致模型产生类似专家模型模仿的“伪推理路径”。尽管这些路径在形式上可能与RL模型的原生推理路径相似,但往往包含冗长、迟疑、信息不足甚至错误的推理步骤。为系统研究这一现象,我们引入VLAA-Thinking,一个新的多模态数据集,旨在支持LVLMs的推理能力。该数据集通过包含captioning、reasoning distillation、answer rewrite和verification的六步流程构建,VLAA-Thinking包含高质量的逐步视觉推理痕迹,用于SFT,同时来自同一数据源的更具挑战性的RL划分。使用该数据集,我们进行了大量实验,比较了SFT、RL及其组合。结果表明,虽然SFT有助于模型学习推理格式,但它往往将对齐模型锁定在模仿性、僵化的推理模式中,阻碍进一步学习。相比之下,基于Group Relative Policy Optimization(GRPO)并引入新型混合奖励模块集成感知与认知信号的RL方法,能培养更真实、更自适应的推理行为。值得注意的是,我们的模型VLAA-Thinker基于Qwen2.5VL 3B,在Open LMM Reasoning Leaderboard中4B规模LVLMs中取得TOP-1性能,超越了前所未有的1.8%。我们希望我们的发现为开发具推理能力的LVLMs提供有价值的见解,并为该领域的未来研究提供指导。
引用
@article{arxiv.2504.11468,
title = {SFT or RL? An Early Investigation into Training R1-Like Reasoning Large Vision-Language Models},
author = {Hardy Chen and Haoqin Tu and Fali Wang and Hui Liu and Xianfeng Tang and Xinya Du and Yuyin Zhou and Cihang Xie},
journal= {arXiv preprint arXiv:2504.11468},
year = {2025}
}