Ferret-v2:基于大型语言模型的指代与定位改进基线
计算机视觉与模式识别
2024-04-12 v1
摘要
虽然 Ferret 将区域理解无缝集成到大型语言模型(LLM)中以促进其指代与定位能力,但它存在某些局限性:受限于预训练的固定视觉编码器,且在更广泛的任务上表现不佳。在本工作中,我们推出了 Ferret-v2,这是对 Ferret 的重大升级,包含三个关键设计。(1) 任意分辨率定位与指代:一种灵活的方法,可轻松处理更高的图像分辨率,提升模型处理和理解更精细图像细节的能力。(2) 多粒度视觉编码:通过集成额外的 DINOv2 编码器,模型能够为全局和细粒度的视觉信息学习更好且多样的底层上下文。(3) 三阶段训练范式:除了图像-字幕对齐之外,在最终的指令微调之前,还提出了一个用于高分辨率密集对齐的额外阶段。实验表明,得益于其高分辨率缩放和细粒度视觉处理,Ferret-v2 相较于 Ferret 及其他最先进的方法取得了显著的改进。
引用
@article{arxiv.2404.07973,
title = {Ferret-v2: An Improved Baseline for Referring and Grounding with Large Language Models},
author = {Haotian Zhang and Haoxuan You and Philipp Dufter and Bowen Zhang and Chen Chen and Hong-You Chen and Tsu-Jui Fu and William Yang Wang and Shih-Fu Chang and Zhe Gan and Yinfei Yang},
journal= {arXiv preprint arXiv:2404.07973},
year = {2024}
}
备注
Preprint. 14 pages, 4 figures