中文

TransMatcher:通过Transformer进行深度图像匹配以实现可泛化行人重识别

计算机视觉与模式识别 2021-12-08 v2

摘要

Transformer近来在计算机视觉中受到越来越多的关注。然而,现有研究大多将Transformer用于特征表示学习,例如图像分类和密集预测,而Transformer的泛化能力尚属未知。在本工作中,我们进一步探究给定图像对时应用Transformer进行图像匹配和度量学习的可能性。我们发现Vision Transformer(ViT)和带解码器的原始Transformer由于缺少图像间注意力而不适于图像匹配。因此,我们进一步设计了两种朴素方案,即在ViT中进行查询-库拼接,以及在原始Transformer中进行查询-库交叉注意力。后者提升了性能,但仍有限。这意味着Transformer中的注意力机制主要为全局特征聚合而设计,并非天然适合图像匹配。据此,我们提出了一种简化的新解码器,舍弃带softmax加权的完整注意力实现,仅保留查询-键相似度计算。此外,应用全局最大池化和多层感知机(MLP)头来解码匹配结果。如此,简化解码器计算更高效,同时更适于图像匹配。所提方法称为TransMatcher,在可泛化行人重识别中达到最先进性能,在多个流行数据集上Rank-1和mAP分别提升高达6.1%和5.7%。代码见https://github.com/ShengcaiLiao/QAConv。

关键词

引用

@article{arxiv.2105.14432,
  title  = {TransMatcher: Deep Image Matching Through Transformers for Generalizable Person Re-identification},
  author = {Shengcai Liao and Ling Shao},
  journal= {arXiv preprint arXiv:2105.14432},
  year   = {2021}
}

备注

Accepted by NeurIPS 2021