Mags-RL:借助代理强化学习为多模态 LLM 搭载放大镜进行复杂场景推理
计算机视觉与模式识别
2026-05-28 v1
摘要
尽管多模态大语言模型(MLLMs)备受推崇且取得成功,但它们常常难以准确解释图像,从而限制了在复杂场景(如高对象密度和复杂背景杂乱)中的推理能力。以往工作主要通过融合需要额外标注的显式视觉线索(如边界框)来解决此限制,但所得低分辨率裁剪图往往会遗漏 MLLMs 所需的细粒度细节以进行准确推理。因此,我们提出 Mags-RL(Mags-RL: Wearing Multimodal LLMs a Magnifying Glass via Agentic Reinforcement Learning For Complex Scene Reasoning),一个代理强化学习(RL)框架,为 MLLMs 配备外部超分辨率“放大镜”代理,以进行高分辨率细粒度检查。具体而言,模型进行两轮推理:第一轮生成初始论据并自主识别感兴趣区域,而无需依赖额外标注;第二轮调用超分辨率代理对这些区域进行裁剪和升频,然后重新审视并验证其先前的推理,以生成最终答案。我们还引入一种新颖的课程学习策略,使 RL 训练数据高效,仅需 40 条训练样本即可获得理想性能。在 VSR、TallyQA 和 GQA 子集上实验表明,我们的方法在最新强竞争方法面前表现优异,展现出高质量推理和精确视觉 grounding 能力。代码和模型权重将很快公开。
引用
@article{arxiv.2605.27960,
title = {Mags-RL: Wearing Multimodal LLMs a Magnifying Glass via Agentic Reinforcement Learning For Complex Scene Reasoning},
author = {Xuanzhao Dong and Wenhui Zhu and Peijie Qiu and Xiwen Chen and Xiaobing Yu and Xin Li and Zhipeng Wang and Shao Tang and Gen Li and Yujian Xiong and Hao Wang and Yanxi Chen and Prayag Tiwari and Yalin Wang},
journal= {arXiv preprint arXiv:2605.27960},
year = {2026}
}