中文

学习聚焦与精确裁剪:面向多模态大语言模型的具有信息间隙与接地损失的强化学习框架

计算机视觉与模式识别 2026-04-14 v2 人工智能

摘要

为了增强多模态大语言模型(MLLMs)在复杂视觉场景中的感知与推理能力,近期研究引入了基于智能体的工作流。在这些工作中,MLLMs自主利用图像裁剪工具分析感兴趣区域以进行问答。虽然现有的训练策略(如监督微调和强化学习)已取得显著进展,但我们的经验分析揭示了一个关键局限。我们证明了模型对全局输入的强烈依赖以及其对裁剪区域内部细节的微弱依赖。为解决这一问题,我们提出了一种新颖的无需轨迹监督的两阶段强化学习框架。在第一阶段,我们通过调整全局图像粒度引入“信息间隙”机制。该机制通过这些区域提供的信息增益驱动,训练模型聚焦于裁剪的关键区域来回答问题。第二阶段通过引入接地损失进一步提高了裁剪精度,使用少量边界框标注。实验表明,我们的方法显著增强了模型对裁剪区域的注意力,使其在高分辨率视觉问答基准上取得了最先进性能。我们的方法为MLLMs中感知和推理细粒度细节提供了一种更高效的途径。代码可在:https://github.com/XuanPu-Z/LFPC。

关键词

引用

@article{arxiv.2603.27494,
  title  = {Learning to Focus and Precise Cropping: A Reinforcement Learning Framework with Information Gaps and Grounding Loss for MLLMs},
  author = {Xuanpu Zhao and Zhentao Tan and Dianmo Sheng and Tianxiang Chen and Yao Liu and Yue Wu and Tao Gong and Qi Chu and Nenghai Yu},
  journal= {arXiv preprint arXiv:2603.27494},
  year   = {2026}
}

备注

Accepted by CVPR 2026