中文

Glance-or-Gaze:通过强化学习激励 LMMs 主动聚焦搜索

计算机视觉与模式识别 2026-04-30 v2 人工智能

摘要

大型多模态模型 (LMM) 在视觉理解方面取得了显著进展,但在知识密集型查询(涉及长尾实体或不断变化的信息)方面仍面临挑战,因其参数化知识为静态。近期的搜索增强方法试图解决此限制,但现有方法依赖于无差别的整体图像检索,导致显著的视觉冗余和噪声,缺乏深度的迭代反思,限制了在复杂视觉查询上的效果。为克服这些挑战,我们提出 Glance-or-Gaze (GoG) 框架,将从被动感知转向主动视觉规划。GoG 引入选择性凝视机制,动态选择是聚焦全局上下文还是凝视高价值区域,以过滤无关信息并进行检索。我们设计了双阶段训练策略:通过监督微调实现反思性 GoG 行为对齐,同时通过复杂度自适应强化学习进一步提升模型处理复杂查询的能力。跨六大基准测试的实验表明,我们的方法在性能上实现了最新水平。消融研究确认,选择性凝视和复杂度自适应 RL 均对有效视觉搜索至关重要。

引用

@article{arxiv.2601.13942,
  title  = {Glance-or-Gaze: Incentivizing LMMs to Adaptively Focus Search via Reinforcement Learning},
  author = {Hongbo Bai and Yujin Zhou and Yile Wu and Chi-Min Chan and Pengcheng Wen and Kunhao Pan and Sirui Han and Yike Guo},
  journal= {arXiv preprint arXiv:2601.13942},
  year   = {2026}
}