强化细调在视觉任务中的适用性
计算机视觉与模式识别
2025-09-23 v2
摘要
强化细调(RFT)被证明对于增强大语言模型(LLM)的推理能力具有重要价值。研究人员开始将RFT应用于多模态大语言模型(MLLMs),希望它也能增强视觉理解能力。然而,这些工作仍处于早期阶段,尚未考察RFT实际上是否适合视觉任务。本文通过实验分析和观察,旨在理解RFT在视觉任务中的适用性与局限性。我们首先在各种任务上进行定量比较,结果显示RFT在视觉任务上通常优于SFT。尤其是在训练样本数量有限时,优势尤为明显。为检查这种优势是否源于推理过程,我们设计了一种鼓励模型“思考”的新奖励,其结果显示,更多的思考对复杂任务有益,但对简单任务有害。我们希望本研究能为该主题的快速发展提供更多见解。
引用
@article{arxiv.2504.05682,
title = {On the Suitability of Reinforcement Fine-Tuning to Visual Tasks},
author = {Xiaxu Chen and Wei Li and Chunxu Liu and Chi Xie and Xiaoyan Hu and Chengqian Ma and Feng Zhu and Rui Zhao},
journal= {arXiv preprint arXiv:2504.05682},
year = {2025}
}