中文

GRIT:教会 MLLMs 以图像思考

计算机视觉与模式识别 2026-05-12 v2 人工智能 计算与语言

摘要

最近的研究表明,使用强化学习(RL)构建能在生成最终答案前 articulates 思维链的推理模型具有效用。然而,尽管旨在为视觉语言任务启用推理的进展不断,现有开源视觉推理模型通常仅生成纯天然语言的推理内容,缺乏对视觉信息的显式集成。这限制了其产生清晰且视觉上可 grounding 推理链的能力。为此,我们提出 Grounded Reasoning with Images and Texts(GRIT),一种 novel 方法,用于训练使 MLLMs 能就图像思考的技术。GRIT 引入了一种 grounded reasoning 范式,即模型生成的推理链交替包含天然语言和显式的边界框坐标。这些坐标指向输入图像中模型在推理过程中参考的区域。此外,GRIT 配备了一种基于 GRPO 算法的强化学习方法——GRPO-GR。GRPO-GR 采用聚焦最终答案准确性和 grounded reasoning 输出格式的 robust rewards,消除对带推理链注释或显式边界框标签数据的需求。结果,GRIT 实现了卓越的数据效率,仅需 20 个图像-问题-答案三元组即可。全面评估表明,GRIT 有效训练 MLLMs 产生连贯且视觉上可 grounding 推理链,成功实现了推理与 grounding 能力的统一。

关键词

引用

@article{arxiv.2505.15879,
  title  = {GRIT: Teaching MLLMs to Think with Images},
  author = {Yue Fan and Xuehai He and Diji Yang and Kaizhi Zheng and Ching-Chen Kuo and Yuting Zheng and Sravana Jyothi Narayanaraju and Xinze Guan and Xin Eric Wang},
  journal= {arXiv preprint arXiv:2505.15879},
  year   = {2026}
}