中文

通过强化学习提高多图像 grounding 在 MLLMs 中的推理能力

计算机视觉与模式识别 2026-04-14 v3

摘要

多模态大型语言模型(MLLM)在单图像视觉 grounding 中表现良好,但在需要跨图像推理和多模态指令的实际任务中仍感到挑战。为此,我们采用基于强化学习(RL)的 MLLM 在多图像 grounding 任务中的后训练策略。我们首先合成高质量的链式思考(CoT)数据用于冷启动初始化,随后使用低秩适应(LoRA)进行监督微调(SFT)。随后,我们对合并后的 SFT 模型进行重新抽样,以筛选可靠的 RL 数据,并使用基于规则的 RL 指导模型走向最优推理路径。大量实验表明,我们的方法有效, 在 MIG-Bench 上提升了9.04%,在七个跨域基准测试中平均提升了4.41%。

关键词

引用

@article{arxiv.2507.00748,
  title  = {Improving the Reasoning of Multi-Image Grounding in MLLMs via Reinforcement Learning},
  author = {Bob Zhang and Haoran Li and Tao Zhang and Jianan Li and Cilin Yan and Xikai Liu and Jiayin Cai and Yanbin Hao},
  journal= {arXiv preprint arXiv:2507.00748},
  year   = {2026}
}

备注

5 pages