中文

长链CoT SFT与RL的协作困境:探究推理VLM的后训练技术

计算与语言 2025-07-11 v1

摘要

大型视觉语言模型(VLMs)日益采用后训练技术,如长链思维(chain-of-thought, CoT)监督微调(SFT)和强化学习(RL),以激发复杂推理能力。尽管这些方法在仅语言模型中表现出协同作用,但在VLMs中联合有效性仍存疑问。我们系统性地探讨了长CoT SFT与RL在多模态推理基准测试中的独立作用及相互作用。我们发现,SFT通过深入、结构化的推理在解答困难问题方面取得进步,但会引入冗长并在解答简单问题时表现下降。相比之下,RL促进了泛化与简洁,无论难度如何都能稳步提升,但在最难问题上的提升不如SFT显著。意外地,通过两种阶段、交错或渐进式训练策略,以及数据混合和模型合并,所有方法均未获得叠加性收益,反而在准确率、推理风格和响应长度之间产生权衡。这一“协作困境”凸显了在推理VLMs中结合后训练技术以发挥最大潜力的需求,亟需更无缝、自适应的方法。

关键词

引用

@article{arxiv.2507.07562,
  title  = {The Synergy Dilemma of Long-CoT SFT and RL: Investigating Post-Training Techniques for Reasoning VLMs},
  author = {Jierun Chen and Tiezheng Yu and Haoli Bai and Lewei Yao and Jiannan Wu and Kaican Li and Fei Mi and Chaofan Tao and Lei Zhu and Manyi Zhang and Xiaohui Li and Lu Hou and Lifeng Shang and Qun Liu},
  journal= {arXiv preprint arXiv:2507.07562},
  year   = {2025}
}