中文

CLIP 赋能全品类零样本草图图像检索(细粒度或非细粒度)

计算机视觉与模式识别 2023-03-29 v3

摘要

本文利用 CLIP 进行零样本草图图像检索(ZS-SBIR)。我们深受基础模型近期进展及其似乎提供的无与伦比泛化能力的启发,并首次对其加以调整以惠及草图社区。我们提出了如何最好地实现这种协同作用的新颖设计,涵盖类别设定与细粒度设定(“全”)。我们解决方案的核心是一个提示学习框架。首先我们展示仅引入草图专用提示,就已得到一个类别级 ZS-SBIR 系统,大幅(24.8%)超越所有先前方法——这有力证明了研究 CLIP 与 ZS-SBIR 协同作用的成效。然而进入细粒度设定更为棘手,需要更深入探究该协同作用。为此,我们提出两个具体设计以应对问题的细粒度匹配本质:(i) 一个额外的正则化损失,确保草图与照片间的相对分离在各品类间一致,而金标准独立三元组损失并非如此;(ii) 一种巧妙的块打乱技术,以帮助建立草图-照片对间的实例级结构对应。借助这些设计,我们再次观察到相较先前最优方法约 26.9% 的显著性能提升。若说有何启示,便是所提出的 CLIP 与提示学习范式在应对其他草图相关任务(不限于 ZS-SBIR)时大有前景,其中数据稀缺仍是一大挑战。项目页:https://aneeshan95.github.io/Sketch_LVM/

关键词

引用

@article{arxiv.2303.13440,
  title  = {CLIP for All Things Zero-Shot Sketch-Based Image Retrieval, Fine-Grained or Not},
  author = {Aneeshan Sain and Ayan Kumar Bhunia and Pinaki Nath Chowdhury and Subhadeep Koley and Tao Xiang and Yi-Zhe Song},
  journal= {arXiv preprint arXiv:2303.13440},
  year   = {2023}
}

备注

Accepted in CVPR 2023. Project page available at https://aneeshan95.github.io/Sketch_LVM/