Reason-RFT:面向视觉推理的强化微调框架
计算机视觉与模式识别
2025-10-07 v3 人工智能
摘要
视觉推理能力在理解复杂多模态数据、推动特定领域应用和人工通用智能 (AGI) 中发挥关键作用。现有方法通过链式思考 (CoT) 监督式微调来增强视觉语言模型 (VLM),但依赖严格注释的数据,可能导致过拟合和认知僵化,限制模型在域迁移情况下的泛化能力,降低实际应用场景的适应性。为克服这些限制,我们提出 Reason-RFT,一个用于视觉推理的两阶段强化微调框架。首先,通过精心挑选的 CoT 数据进行监督式微调 (SFT) 激发 VLM 的推理潜能。随后,基于群相对政策优化 (GRPO) 的强化学习生成多个推理-响应对,增强模型对域迁移的适应性。为评估 Reason-RFT,我们重构了覆盖视觉计数、结构感知和空间变换的综合数据集,作为跨三个关键维度的系统性评估基准。实验结果突出三个优势:(1) 性能提升,Reason-RFT 实现最先进成果,超越开源和专有模型;(2) 泛化优势,在各种任务下的域迁移情境中保持稳健性能;(3) 数据效率,在少样本学习场景中大放异彩,超越完整数据集的 SFT 基线。Reason-RFT 引入了视觉推理的新训练范式,标志着多模态研究的重要进展。项目网址:https://tanhuajie.github.io/ReasonRFT
引用
@article{arxiv.2503.20752,
title = {Reason-RFT: Reinforcement Fine-Tuning for Visual Reasoning of Vision Language Models},
author = {Huajie Tan and Yuheng Ji and Xiaoshuai Hao and Xiansheng Chen and Pengwei Wang and Zhongyuan Wang and Shanghang Zhang},
journal= {arXiv preprint arXiv:2503.20752},
year = {2025}
}
备注
51 pages, 23 figures, NeurIPS'25