中文

Mixed-R1:多模态大语言模型推理能力的统一奖励视角

计算与语言 2025-06-18 v1 计算机视觉与模式识别

摘要

关于大型语言模型(LLM)的最新研究已成功展示了通过强化学习(RL)涌现推理能力。尽管近期努力利用群体相对策略优化(GRPO)进行 MLLM 后训练,但它们通常仅探索某一特定方面,例如定位任务、数学问题或图表分析。目前尚无工作能够利用多源 MLLM 任务进行稳定的强化学习。在本研究中,我们提出一个统一的视角来解决这一问题。我们提出了 Mixed-R1,一个统一而直接的框架,包含混合奖励函数设计(Mixed-Reward)和混合后训练数据集(Mixed-45K)。我们首先设计了一个数据引擎来选择高质量样本,以构建 Mixed-45K 后训练数据集。然后,我们提出了 Mixed-Reward 设计,其中包含针对各种 MLLM 任务的各种奖励函数。具体而言,它包含四种不同的奖励函数:用于二元答案或多项选择题的匹配奖励、用于图表感知数据集的图表奖励、用于定位问题的 IoU 奖励,以及用于描述数据集等长文本响应的开放式奖励。为了处理各种长文本内容,我们利用生成响应与真实值之间的分词器嵌入匹配,提出了一种名为双向最大平均相似度(BMAS)的新型开放式奖励。大量实验表明了我们提出的方法在各种 MLLM 上的有效性,包括不同规模的 Qwen2.5-VL 和 Intern-VL。我们的数据集和模型可在 https://github.com/xushilin1/mixed-r1 获取。

关键词

引用

@article{arxiv.2505.24164,
  title  = {Mixed-R1: Unified Reward Perspective For Reasoning Capability in Multimodal Large Language Models},
  author = {Shilin Xu and Yanwei Li and Rui Yang and Tao Zhang and Yueyi Sun and Wei Chow and Linfeng Li and Hang Song and Qi Xu and Yunhai Tong and Xiangtai Li and Hao Fei},
  journal= {arXiv preprint arXiv:2505.24164},
  year   = {2025}
}