中文

思考与否:基于规则的视觉强化微调中显式思考的研究

计算机视觉与模式识别 2025-10-28 v6

摘要

本文研究了显式思考过程在 MLLM 的基于规则的强化微调 (RFT) 中的作用。我们首先提出了用于 MLLM 图像分类的 CLS-RL,使用可验证奖励进行微调。实验表明,CLS-RL 显著优于 SFT,并产生了跨数据集的泛化效果。随后我们重新思考并质疑 RFT 中的显式思考是否总是必要的。针对显式思考对 RFT 成功至关重要的传统观念,我们引入了 No-Thinking-RL,通过引入简单的等式准确率奖励来探索无思考的 RFT。我们在不同模型大小和类型的 6 个不同任务上评估了 No-Thinking-RL。实验结果揭示了三个关键发现:1). 视觉感知任务在 RFT 期间不需要思考,因为 No-Thinking-RL 在不同模型大小上始终优于或匹配基于思考的 RFT。2). 能力有限的模型难以生成高质量的 CoT 以用于 RFT,这使得基于思考的 RFT 不如 No-Thinking-RL 有效。3). 基于思考的 RFT 的某些响应中,思考标签与答案标签中的答案之间存在不一致性,这些答案的准确率低于总体准确率。我们假设,在可验证答案之前的显式思考可能会阻碍奖励收敛并降低性能。为了验证这一假设,我们提出了 Think-After-Answer,将思考置于答案之后以缓解此效应,从而进行实验验证。最后,我们进行了一项初步研究,以探索 MLLM 能否在 RFT 期间学习何时进行思考,引入了 Adaptive-Thinking 方法。实验表明,它会根据模型能力和任务复杂度收敛到特定的提示,取得与 Thinking 和 No-Thinking-RL 相当或更好的性能。这表明 MLLM 能够根据自身能力和任务复杂度自适应地决定是否思考。

关键词

引用

@article{arxiv.2503.16188,
  title  = {Think or Not Think: A Study of Explicit Thinking in Rule-Based Visual Reinforcement Fine-Tuning},
  author = {Ming Li and Jike Zhong and Shitian Zhao and Yuxiang Lai and Haoquan Zhang and Wang Bill Zhu and Kaipeng Zhang},
  journal= {arXiv preprint arXiv:2503.16188},
  year   = {2025}
}

备注

Neurips 2025 Spotlight