中文

探究视觉Transformer模型在图像检索任务中的应用

计算机视觉与模式识别 2021-01-12 v1 信息检索 机器人学

摘要

本文提出了一种即插即用的描述子,可有效用于图像检索任务,无需先验初始化或准备。该描述方法利用近期提出的Vision Transformer网络,且不需要任何训练数据来调整参数。近年来,在图像检索任务中,基于卷积神经网络(CNN)的方法已非常成功地取代了手工设计的全局与局部描述子。然而,本文在多个基准数据集上针对文献中36种最先进(SOTA)描述子开展的实验评估表明,一个不含卷积层的神经网络(如Vision Transformer)能够构建全局描述子并取得具有竞争力的结果。由于无需微调,所提方法的低复杂度鼓励将该架构作为图像检索基线模型采用,以取代传统且被广泛采用的基于CNN的方法,并开启图像检索方法的新纪元。

关键词

引用

@article{arxiv.2101.03771,
  title  = {Investigating the Vision Transformer Model for Image Retrieval Tasks},
  author = {Socratis Gkelios and Yiannis Boutalis and Savvas A. Chatzichristofis},
  journal= {arXiv preprint arXiv:2101.03771},
  year   = {2021}
}