中文

用于图像检索的视觉Transformer哈希方法

计算机视觉与模式识别 2022-03-23 v2

摘要

深度学习在图像检索的哈希技术中展现出巨大发展。近来,Transformer 作为一种利用自注意力且无需卷积的新架构而出现。Transformer 也被扩展为 Vision Transformer(ViT)用于视觉识别,在 ImageNet 上表现出有前景的性能。在本文中,我们提出一种基于 Vision Transformer 的哈希方法(VTS)用于图像检索。我们利用在 ImageNet 上预训练的 ViT 作为骨干网络并添加哈希头。所提出的 VTS 模型在六种不同图像检索框架下针对哈希进行微调,包括 Deep Supervised Hashing(DSH)、HashNet、GreedyHash、Improved Deep Hashing Network(IDHN)、Deep Polarized Network(DPN)和 Central Similarity Quantization(CSQ)及其目标函数。我们在 CIFAR10、ImageNet、NUS-Wide 和 COCO 数据集上进行了大量实验。所提出的基于 VTS 的图像检索以较大优势优于近期最先进的哈希技术。我们还发现所提出的 VTS 模型作为骨干网络优于现有网络,如 AlexNet 和 ResNet。代码发布于 \url{https://github.com/shivram1987/VisionTransformerHashing}。

关键词

引用

@article{arxiv.2109.12564,
  title  = {Vision Transformer Hashing for Image Retrieval},
  author = {Shiv Ram Dubey and Satish Kumar Singh and Wei-Ta Chu},
  journal= {arXiv preprint arXiv:2109.12564},
  year   = {2022}
}

备注

Accepted in IEEE International Conference on Multimedia and Expo (ICME), 2022