中文

通过文本去偏见的 Hint-GRPO 提升多模态大语言模型推理能力

计算机视觉与模式识别 2025-06-30 v2

摘要

多模态大语言模型(MLLM)推理因其出色的问题解决能力而引起广泛关注。当前的推理方法可分为两类:一种是监督中间推理步骤的 PRM,另一种是监督最终结果的 ORM。最近,DeepSeek-R1 对传统观点(即 PRM 优于 ORM)提出了挑战,表明使用 ORM 方法(即 GRPO)可实现强大的泛化性能。然而,当前 MLLM 的 GRPO 算法仍难以处理具有挑战性和复杂性的多模态推理任务(例如数学推理)。本文揭示了 GRPO 在 MLLM 上存在两个问题:数据利用率低和文本偏差。低数据利用率指 GRPO 无法在困难样本上获得正向奖励来更新 MLLM;文本偏差指 MLLM 在 GRPO 训练后仅依赖文本条件生成,而忽略图像条件。为解决这些问题,本文提出 Hint-GRPO,通过为难度不同的样本提供适应性提示来提高数据利用率,以及文本偏差校准,通过在测试时对 token 预测 logits 进行校准以消除文本偏差。在三个基础 MLLM 上通过十一个数据集的实验结果表明,我们提出的方法显著提升了原始 MLLM 的推理能力,性能优于现有的 MLLM 推理方法。我们的代码已公开:https://github.com/hqhQAQ/Hint-GRPO。

关键词

引用

@article{arxiv.2503.23905,
  title  = {Boosting MLLM Reasoning with Text-Debiased Hint-GRPO},
  author = {Qihan Huang and Weilong Dai and Jinlong Liu and Wanggui He and Hao Jiang and Mingli Song and Jingyuan Chen and Chang Yao and Jie Song},
  journal= {arXiv preprint arXiv:2503.23905},
  year   = {2025}
}