CLIP-VG:面向视觉定位的 CLIP 自定进度课程自适应
计算机视觉与模式识别
2024-11-20 v5
摘要
视觉定位(VG)是视觉与语言领域的关键课题,涉及在图像中定位由表述描述的特定区域。为减少对人工标注数据的依赖,无监督视觉定位已被发展以利用伪标签定位区域。然而,现有无监督方法的性能高度依赖于伪标签的质量,且这些方法总是遇到多样性有限的问题。为利用视觉与语言预训练模型解决定位问题,并合理利用伪标签,我们提出 CLIP-VG,一种新颖的方法,能够利用伪语言标签对 CLIP 进行自定进度课程自适应。我们提出一种简单而高效的端到端网络架构,以实现 CLIP 到视觉定位的迁移。基于该 CLIP 架构,我们进一步提出单源与多源课程自适应算法,可逐步发现更可靠的伪标签以学习最优模型,从而在伪语言标签的可靠性与多样性之间取得平衡。我们的方法在 RefCOCO/+/g 数据集上的单源与多源场景下,分别以 6.78 到 10.67 和 11.39 到 14.87 的提升幅度,显著优于当前最先进的无监督方法。结果甚至优于现有的弱监督视觉定位方法。此外,我们的方法在全监督设定下也具有竞争力。代码与模型可在 https://github.com/linhuixiao/CLIP-VG 获取。
引用
@article{arxiv.2305.08685,
title = {CLIP-VG: Self-paced Curriculum Adapting of CLIP for Visual Grounding},
author = {Linhui Xiao and Xiaoshan Yang and Fang Peng and Ming Yan and Yaowei Wang and Changsheng Xu},
journal= {arXiv preprint arXiv:2305.08685},
year = {2024}
}
备注
Accepted by IEEE Transaction on Multimedia (2023), Paper page: https://ieeexplore.ieee.org/abstract/document/10269126. Code are available at https://github.com/linhuixiao/CLIP-VG