Griffon:利用大语言模型以任意粒度拼写出所有目标位置
计算机视觉与模式识别
2024-10-10 v3 人工智能
摘要
复现人类基于自由形式文本在任何粒度下检测所有目标的先天能力,对大型视觉语言模型(LVLMs)而言仍是一项艰巨挑战。当前的 LVLMs 主要局限于定位单个、已存在的对象。这一限制导致模型设计上的妥协,需要引入视觉专家模型或定制头部结构。除这些约束外,我们的研究揭示了 LVLMs 的基本目标感知能力,使其能准确识别并定位感兴趣的对象。基于这一洞见,我们引入了一种新颖的语言提示定位数据集,以充分释放 LVLMs 在细粒度目标感知和精确定位意识方面的能力。更重要的是,我们提出了 Griffon,一个纯粹的基于 LVLM 的基线,它不引入任何特殊标记、专家模型或额外的检测模块。它通过统一各种定位相关场景的数据格式,并保持与流行 LVLMs 一致的结构,通过精心设计的流程进行端到端训练。综合实验表明,Griffon 不仅在细粒度的 RefCOCO 系列和 Flickr30K Entities 上达到了最先进性能,还逼近了专家模型 Faster RCNN 在检测基准 MSCOCO 上的能力。数据、代码和模型发布于 https://github.com/jefferyZhan/Griffon。
引用
@article{arxiv.2311.14552,
title = {Griffon: Spelling out All Object Locations at Any Granularity with Large Language Models},
author = {Yufei Zhan and Yousong Zhu and Zhiyang Chen and Fan Yang and Ming Tang and Jinqiao Wang},
journal= {arXiv preprint arXiv:2311.14552},
year = {2024}
}
备注
ECCV2024, Github: https://github.com/jefferyZhan/Griffon