GroundVLP:利用视觉-语言预训练与开放词汇目标检测实现零样本视觉定位
计算机视觉与模式识别
2023-12-27 v1
摘要
视觉定位是一项重要的视觉-语言任务,涉及基于查询表达式理解视觉上下文,要求模型捕捉对象之间的交互以及各种空间和属性信息。然而,由于标注过程耗时且费力,视觉定位任务的标注数据有限,导致训练出的模型在向更广泛领域泛化时受到限制。为应对这一挑战,我们提出了 GroundVLP,一种简单而有效的零样本方法,利用基于图像-文本对和纯目标检测数据训练的现有模型来获得视觉定位能力;与视觉定位标注数据相比,这两类数据更易获取且覆盖更广的领域。GroundVLP 提出了一种融合机制,将来自 GradCAM 的热力图与开放词汇检测器的候选区域相结合。我们证明,所提方法在 RefCOCO/+/g 数据集上显著优于其他零样本方法,在 RefCOCO 和 RefCOCO+ 的测试集上超越先前零样本 SOTA 约 28%。此外,在 Flickr30k entities 数据集上,GroundVLP 的表现与某些基于非 VLP 的监督模型相当甚至更好。我们的代码可在 https://github.com/om-ai-lab/GroundVLP 获取。
引用
@article{arxiv.2312.15043,
title = {GroundVLP: Harnessing Zero-shot Visual Grounding from Vision-Language Pre-training and Open-Vocabulary Object Detection},
author = {Haozhan Shen and Tiancheng Zhao and Mingwei Zhu and Jianwei Yin},
journal= {arXiv preprint arXiv:2312.15043},
year = {2023}
}