用于无监督图像检索的基于 Transformer 的截断对比量化学习
计算机视觉与模式识别
2024-01-30 v1
摘要
无监督图像检索旨在没有任何给定级别的情况下学习重要的视觉特征,以检索与给定查询图像相似的图像。基于卷积神经网络(CNN)的方法已被广泛应用于图像哈希的自监督对比学习。然而,现有方法由于 CNN 缺乏对全局特征的有效利用以及对比学习中假负对造成的偏差而受到影响。在本文中,我们提出了一种 TransClippedCLR 模型,该模型通过使用基于分块处理具有局部上下文的 Transformer 来编码图像的全局上下文,通过乘积量化生成哈希码,并通过截断对比学习避免潜在的假负对。在基准数据集(包括 CIFAR10、NUS-Wide 和 Flickr25K)上的测试表明,与最新的 SOTA 深度模型相比,所提出的模型在无监督图像检索方面表现出更优的性能。与使用原始对比学习的相同骨干网络相比,使用所提出的截断对比学习在所有数据集上的结果均有大幅提升。
关键词
引用
@article{arxiv.2401.15362,
title = {Transformer-based Clipped Contrastive Quantization Learning for Unsupervised Image Retrieval},
author = {Ayush Dubey and Shiv Ram Dubey and Satish Kumar Singh and Wei-Ta Chu},
journal= {arXiv preprint arXiv:2401.15362},
year = {2024}
}