中文

R-4B:通过双模态退火和强化学习激励 MLLMs 通用自思考能力

计算机视觉与模式识别 2025-09-03 v2 人工智能 机器学习

摘要

具备逐步思考能力的多模态大语言模型 (MLLMs) 在复杂推理问题上已显示出惊人的性能。然而,这种思考过程对于无需复杂推理即可解决的简单问题来说是冗余的。为此,我们提出了 R-4B,一种自动思考 MLLM,它可以根据问题复杂度自适应决定是否思考。R-4B 的核心思想是通过双模态退火赋予模型具备思考和非思考能力,并应用双模态策略优化 (BPO) 来提高模型在确定是否激活思考过程方面的准确性。 Specifically,我们首先在覆盖various主题的精心策划的数据集上训练模型,该数据集包含来自思考和非思考模式的样本。然后,它在改进的 GRPO 框架下的第二个训练阶段进行,策略模型被迫为每个输入查询生成来自两种模式的响应。实验结果表明,R-4B 在 25 个具有挑战性的基准测试中实现了最先进的性能。在大多数任务中,它超过了 Qwen2.5-VL-7B,并在推理密集型基准测试中以较低的计算成本达到与 Kimi-VL-A3B-Thinking-2506 (16B) 等更大模型相当的性能。

关键词

引用

@article{arxiv.2508.21113,
  title  = {R-4B: Incentivizing General-Purpose Auto-Thinking Capability in MLLMs via Bi-Mode Annealing and Reinforce Learning},
  author = {Qi Yang and Bolin Ni and Shiming Xiang and Han Hu and Houwen Peng and Jie Jiang},
  journal= {arXiv preprint arXiv:2508.21113},
  year   = {2025}
}

备注

20 pages, 14 figures, 5 tables