训练视觉 Transformer 用于图像检索
计算机视觉与模式识别
2021-02-11 v1
摘要
Transformer 在自然语言理解以及更近期的图像分类中展示了卓越结果。我们在此扩展该工作并提出一种基于 transformer 的图像检索方法:我们采用视觉 transformer 生成图像描述子,并以结合对比损失与微分熵正则化器的度量学习目标训练所得模型。我们的结果显示 transformer 相比基于卷积的方法有一致且显著的提升。特别地,我们的方法在多个类别级检索公开基准(即 Stanford Online Product、In-Shop 和 CUB-200)上优于当前最优。此外,我们在 ROxford 和 RParis 上的实验也表明,在可比设置下,transformer 对特定物体检索具有竞争力,尤其在短向量表示和低分辨率图像的情形中。
引用
@article{arxiv.2102.05644,
title = {Training Vision Transformers for Image Retrieval},
author = {Alaaeldin El-Nouby and Natalia Neverova and Ivan Laptev and Hervé Jégou},
journal= {arXiv preprint arXiv:2102.05644},
year = {2021}
}