提升视觉Transformer用于图像检索的性能
计算机视觉与模式识别
2022-10-24 v1 信息检索
机器学习
摘要
视觉Transformer在图像分类与检测等视觉任务中已取得显著进展。然而,在实例级图像检索中,与卷积网络相比,Transformer尚未表现出良好性能。我们提出若干改进,使Transformer首次超越最先进水平。(1)我们表明混合架构比纯Transformer有效得多,且优势明显。(2)我们引入两个分支分别收集全局(分类令牌)与局部(图像块令牌)信息,并由此形成全局图像表示。(3)在每个分支中,我们从Transformer编码器收集多层特征,对应于跨远距离层的跳跃连接。(4)我们增强了编码器更深层的相互作用局部性,这是视觉Transformer的相对弱点。我们在所有常用训练集上训练模型,并首次针对每个训练集分别进行公平比较。在所有情况下,我们都优于先前基于全局表示的模型。公开代码见 https://github.com/dealicious-inc/DToP。
引用
@article{arxiv.2210.11909,
title = {Boosting vision transformers for image retrieval},
author = {Chull Hwan Song and Jooyoung Yoon and Shunghyun Choi and Yannis Avrithis},
journal= {arXiv preprint arXiv:2210.11909},
year = {2022}
}
备注
WACV 2023