TransHash:基于Transformer的汉明哈希高效图像检索方法
计算机视觉与模式识别
2021-05-06 v1
摘要
深度汉明哈希在大规模图像检索的近似最近邻搜索中日益受到关注。迄今为止,图像检索领域的深度哈希一直由卷积神经网络架构主导,例如 \texttt{Resnet}\cite{he2016deep}。本文受视觉Transformer近期进展的启发,提出 \textbf{Transhash},一种基于纯Transformer的深度哈希学习框架。具体而言,我们的框架由两个主要模块组成:(1) 基于 \textit{Vision Transformer}(ViT),我们设计了一个孪生视觉Transformer骨干网络用于图像特征提取。为学习细粒度特征,我们在Transformer之上创新了双流特征学习,以学习有判别性的全局与局部特征。(2) 此外,我们采用带有动态构建相似度矩阵的贝叶斯学习方案来学习紧凑的二进制哈希码。整个框架以端到端方式联合训练。~据我们所知,这是首个无需卷积神经网络(\textit{CNNs})解决深度哈希学习问题的工作。我们在三个广泛研究的数据集上进行了综合实验:\textbf{CIFAR-10}、\textbf{NUSWIDE} 和 \textbf{IMAGENET}。实验证明了我们相对于现有最先进深度哈希方法的优越性。具体而言,在三个公开数据集上,针对不同哈希比特长度,我们的平均 \textit{mAP} 分别取得了 8.2%、2.6%、12.7% 的性能提升。
引用
@article{arxiv.2105.01823,
title = {TransHash: Transformer-based Hamming Hashing for Efficient Image Retrieval},
author = {Yongbiao Chen and Sheng Zhang and Fangxin Liu and Zhigang Chang and Mang Ye and Zhengwei Qi},
journal= {arXiv preprint arXiv:2105.01823},
year = {2021}
}