CLAIR:CLIP辅助的弱监督零样本跨域图像检索
计算机视觉与模式识别
2025-08-19 v1
摘要
近期大型基础模型的增长使得能够轻松为海量无标签数据生成伪标签,使得无监督零样本跨域图像检索(unsupervised Zero-Shot Cross-Domain Image Retrieval, UZS-CDIR)变得不那么相关。因此,我们转向关注弱监督零样本跨域图像检索(weakly supervised ZS-CDIR, WSZS-CDIR),使用来自大型基础模型(如CLIP)生成的带噪声的伪标签。为此,我们提出CLAIR以从CLIP文本和图像特征之间的相似性中获得的置信度分数来细化带噪声的伪标签。此外,我们设计了跨实例和跨簇对比损失,以将图像编码到受类注意的潜在空间中,同时设计了跨域对比损失以缓解域间差异。我们还使用仅来自CLIP文本嵌入的闭形式学习一种新型的跨域映射函数,从而进一步对齐图像特征以实现检索。最后,我们通过引入一组可学习的提示词来增强CLAIR的零样本泛化能力,以处理新类别。我们在TUBerlin、Sketchy、Quickdraw和DomainNet等大量零样本数据集上进行了广泛实验,其中我们的CLAIR始终显示出优于现有最先进方法的优异性能。
引用
@article{arxiv.2508.12290,
title = {CLAIR: CLIP-Aided Weakly Supervised Zero-Shot Cross-Domain Image Retrieval},
author = {Chor Boon Tan and Conghui Hu and Gim Hee Lee},
journal= {arXiv preprint arXiv:2508.12290},
year = {2025}
}
备注
BMVC 2025