中文

Granulon:唤醒像级视觉编码器的自适应多粒度语义

计算机视觉与模式识别 2026-03-11 v1

摘要

最近的多模态大语言模型进展主要依赖 CLIP 基于视觉编码器,这些模型强调全局语义对齐,但在细粒度视觉理解方面存在挑战。相比之下,DINOv3 提供了强大的像级感知能力,但缺乏粗粒度语义抽象,导致多粒度推理受限。为此,我们提出了 Granulon,一个新颖的 DINOv3 基于 MLLM,具备自适应粒度增强。Granulon 引入文本条件化粒度 Controller,根据文本输入的语义范围动态调整视觉抽象层级,并引入自适应 Token 聚合模块,以进行粒度引导的池化和关系感知聚类,以产生紧凑且语义丰富的视觉 token。此设计使单次前向传播内实现统一的 "像级-细粒度-粗粒度" 推理。大量可解释实验表明,Granulon 在准确率上提升约 30%, hallucination 降低约 20%,在相同设置下超越所有视觉编码器。

关键词

引用

@article{arxiv.2603.08800,
  title  = {Granulon: Awakening Pixel-Level Visual Encoders with Adaptive Multi-Granularity Semantics for MLLM},
  author = {Junyuan Mao and Qiankun Li and Linghao Meng and Zhicheng He and Xinliang Zhou and Kun Wang and Yang Liu and Yueming Jin},
  journal= {arXiv preprint arXiv:2603.08800},
  year   = {2026}
}