中文

Grasp Any Region:面向多模态大语言模型的精准、情境化像素级理解

计算机视觉与模式识别 2026-03-06 v3 人工智能 计算与语言

摘要

虽然多模态大语言模型(MLLM)在整体理解方面表现出色,但在捕捉复杂场景中密集的世界时仍面临挑战,需要对细节和对象间复杂关系进行精细分析。区域级MLLM是一项有前景的研究方向。然而,之前的尝试通常针对孤立的给定区域进行优化,忽略了至关重要的全局上下文。为此,我们引入Grasp Any Region(GAR),实现全面区域级视觉理解。借助有效的区域注意力对齐特征重放技术,GAR支持(1)利用必要的全局上下文实现精确感知,(2)建模多个提示之间的相互作用。随后,它自然实现(3)针对任何区域的特定开放式问题进行高级组合推理,使其从被动描述转向主动对话。此外,我们构建了GAR-Bench,既提供更准确的单区域理解评估,更重要的是衡量跨多个区域的相互作用和复杂推理。大量实验表明,GAR-1B不仅保持了最先进的captioning能力(例如在DLC-Bench上超越DAM-3B 4.5),而且在建模多个提示之间的关系方面表现出色,理解能力先进,甚至在GAR-Bench-VQA上超越InternVL3-78B。更重要的是,我们的零样本GAR-8B在VideoRefer-BenchQ上对VideoRefer-7B的原地测试效果也优于后者,表明其强大的能力可以轻松迁移到视频领域。

关键词

引用

@article{arxiv.2510.18876,
  title  = {Grasp Any Region: Towards Precise, Contextual Pixel Understanding for Multimodal LLMs},
  author = {Haochen Wang and Yuhao Wang and Tao Zhang and Yikang Zhou and Yanwei Li and Jiacong Wang and Jiani Zheng and Ye Tian and Jiahao Meng and Zilong Huang and Guangcan Mai and Anran Wang and Yunhai Tong and Zhuochen Wang and Xiangtai Li and Zhaoxiang Zhang},
  journal= {arXiv preprint arXiv:2510.18876},
  year   = {2026}
}

备注

ICLR 2026 Camera Ready Version