Griffon v2:通过高分辨率缩放和视觉语言共指实现多模态感知的进阶
计算机视觉与模式识别
2025-08-12 v2 人工智能
摘要
大型视觉语言模型已实现精细的对象感知,但图像分辨率的限制仍是无法超越复杂稠密场景中任务特定专家性能的显著障碍。这种限制进一步限制了模型在GUI智能体、计数等领域实现精细视觉和语言指代的潜力。为此,我们引入了一个统一的高分辨率通用型模型Griffon v2,使其能够通过视觉和文本提示进行灵活的对象指代。为高效缩放图像分辨率,我们设计了一种简单轻量的下采样投影器,以克服大型语言模型中输入标记的限制。该设计本质上保留了完整的上下文和细节,显著提升了多模态感知能力,尤其对于小对象。基于此,我们进一步通过可插即用的视觉标记化器为模型增添了视觉语言共指能力。它使模型能够与灵活的目标图像、自由形式的文本乃至坐标进行用户友好的交互。实验表明,Griffon v2能够通过视觉和文本指代定位感兴趣的对象,在REC和短语 grounding 方面实现了最先进的性能,并在对象检测、对象计数和REG中超越了专家模型。数据和代码已发布于https://github.com/jefferyZhan/Griffon。
引用
@article{arxiv.2403.09333,
title = {Griffon v2: Advancing Multimodal Perception with High-Resolution Scaling and Visual-Language Co-Referring},
author = {Yufei Zhan and Shurong Zheng and Yousong Zhu and Hongyin Zhao and Fan Yang and Ming Tang and Jinqiao Wang},
journal= {arXiv preprint arXiv:2403.09333},
year = {2025}
}
备注
Accepted by ICCV 2025. Codes and datasets are released at https://github.com/jefferyZhan/Griffon