中文

基于强化学习的高分辨率大型多模态模型无标注视觉推理

计算机视觉与模式识别 2026-03-10 v2

摘要

当前的大型多模态模型(Large Multimodal Models,LMMs)在推理过程中难以处理高分辨率视觉输入,因为图像标记数随分辨率呈二次增长,引入了大量冗余和无关信息。常见做法是识别关键图像区域,在推理时引用其高分辨率版本,通常需来自人工标注者的外部视觉监督。然而,这类视觉监督需要人工标注者提供昂贵的锚定标签。与此同时,如何在不依赖额外标注的情况下提升模型捕捉能力以支持推理仍是开放问题。本文提出了高分辨率无标注推理技术(High-resolution Annotation-free Reasoning Technique,HART),一个闭环框架,使 LMMs 能够聚焦并自我验证高分辨率视觉输入的关键区域。HART 采用后训练范式,设计了优势偏好组相对策略优化(Advantage Preference Group Relative Policy Optimization,AP-GRPO)以鼓励在无外部视觉标注的情况下准确定位关键区域。值得注意的是,HART 提供可解释的推理路径,使局部化优化更高效。广泛的实验在 MME-RealWorld-Lite、TreeBench、V* Bench、HR-Bench-4K/8K 和 MMStar 上表明,HART 在广泛的高分辨率视觉任务上均取得改进,持续优于强大基线。

关键词

引用

@article{arxiv.2602.23615,
  title  = {Annotation-Free Visual Reasoning for High-Resolution Large Multimodal Models via Reinforcement Learning},
  author = {Jiacheng Yang and Anqi Chen and Yunkai Dang and Qi Fan and Cong Wang and Wenbin Li and Feng Miao and Yang Gao},
  journal= {arXiv preprint arXiv:2602.23615},
  year   = {2026}
}