接地一切:视觉-语言Transformer中涌现的定位能力
计算机视觉与模式识别
2023-12-15 v3 人工智能
摘要
视觉-语言基础模型在各种零样本设置中表现出色,如图像检索、分类或描述。但到目前为止,这些模型在指代表达和图像中物体的零样本定位方面似乎有所欠缺。因此,它们需要针对此任务进行微调。在本文中,我们展示了预训练的视觉-语言(VL)模型无需任何微调即可实现零样本开放词汇物体定位。为了利用这些能力,我们提出了一个接地一切模块(GEM),它将CLIPSurgery引入的值-值注意力概念推广到自-自注意力路径。我们表明,自-自注意力的概念对应于聚类,从而强制来自同一物体的标记组保持相似,同时保持与语言空间的对齐。为了进一步指导组的形成,我们提出了一组正则化方法,使模型最终能够跨数据集和骨干网络进行泛化。我们在各种基准任务和语义分割数据集上评估了所提出的GEM框架。结果表明,GEM不仅优于其他无需训练的开放词汇定位方法,还在最近提出的OpenImagesV7大规模分割基准上取得了最先进的结果。
引用
@article{arxiv.2312.00878,
title = {Grounding Everything: Emerging Localization Properties in Vision-Language Transformers},
author = {Walid Bousselham and Felix Petersen and Vittorio Ferrari and Hilde Kuehne},
journal= {arXiv preprint arXiv:2312.00878},
year = {2023}
}
备注
Code available at https://github.com/WalBouss/GEM