Unicom:面向图像检索的通用紧凑表示学习
计算机视觉与模式识别
2023-04-13 v1
摘要
现代图像检索方法通常依赖于微调预训练编码器来提取图像级描述符。然而,最广泛使用的模型是在类别有限的 ImageNet-1K 上预训练的,因此预训练的特征表示不够通用,难以很好地泛化到多样的开放世界类别。在本文中,我们首先基于 CLIP 模型提取的联合文本与视觉特征,将大规模 LAION400M 聚类为一百万个伪类别。由于标签粒度的混淆,自动聚类的数据集不可避免地包含严重的类间冲突。为缓解此类冲突,我们随机选取部分类间原型来构造基于间隔的 softmax 损失。为进一步增强低维特征表示,我们在计算嵌入与类级原型之间的相似度时随机选取部分特征维度。这种双重随机部分选取分别针对原型矩阵的类维度和特征维度,使得分类对冲突具有鲁棒性且特征嵌入紧凑。我们的方法在多个基准上显著优于最先进的无监督与有监督图像检索方法。代码与预训练模型已发布以促进未来研究 https://github.com/deepglint/unicom。
引用
@article{arxiv.2304.05884,
title = {Unicom: Universal and Compact Representation Learning for Image Retrieval},
author = {Xiang An and Jiankang Deng and Kaicheng Yang and Jaiwei Li and Ziyong Feng and Jia Guo and Jing Yang and Tongliang Liu},
journal= {arXiv preprint arXiv:2304.05884},
year = {2023}
}
备注
Accepted at ICLR2023