GranViT:一种用于多模态大语言模型的细粒度视觉模型
计算机视觉与模式识别
2025-10-27 v1 人工智能
摘要
视觉编码器是实现多模态大语言模型(MLLMs)在视觉问答和推理等视觉语言任务中卓越性能的必备组件。然而,现有视觉编码器关注全局图像表示,忽略了细粒度的区域分析。由于细粒度标注数据的稀缺以及缺乏细粒度预训练范式,现有方法在细粒度感知方面受限。本文提出GranViT,一种新颖的视觉Transformer,集成了细粒度特征提取与语义对齐,通过区域级自回归训练与大语言模型(LLM)对接。我们首先构建Gran-29M数据集,包含200万张自然图像和OCR图像,配有超过1.8亿条高质量的区域级标注,以支持大规模细粒度预训练。随后,我们开发了预训练-适应框架并引入自蒸馈机制,在Gran-29M上训练细粒度GranViT。我们充分利用Gran-29M中的细粒度标注,通过边界框到标题的回归提升视觉编码器的局部表征,在标题到边界框的回归中增强视觉特征的利用与LLM的局部分辨。我们进一步融入自蒸馈机制,对视觉编码器施加显式的局部分辨约束,以强化其区域推理能力。大量实验表明,GranViT超越现有视觉编码器,在各类LLM上的迁移能力卓越。显著的是,它在细粒度识别、多模态VQA和OCR理解等任务上实现最先进的性能。
引用
@article{arxiv.2510.21501,
title = {GranViT: A Fine-Grained Vision Model With Autoregressive Perception For MLLMs},
author = {Guanghao Zheng and Bowen Shi and Mingxing Xu and Ruoyu Sun and Peisen Zhao and Zhibo Zhang and Wenrui Dai and Junni Zou and Hongkai Xiong and Xiaopeng Zhang and Qi Tian},
journal= {arXiv preprint arXiv:2510.21501},
year = {2025}
}
备注
21 pages, 6 figures