HAT:用于行人重识别的分层聚合 Transformer
计算机视觉与模式识别
2021-07-15 v2 人工智能
摘要
近来,随着深度卷积神经网络(CNN)的发展,行人重识别(Re-ID)在各种应用中取得了巨大成功。然而,由于 CNN 有限的感受野,在非重叠相机下为行人提取全局视角的判别性表示仍具挑战。同时,Transformer 对空间与序列数据建模长程依赖展现出强大能力。本工作中,我们结合 CNN 与 Transformer 的优势,提出一种名为分层聚合 Transformer(Hierarchical Aggregation Transformer, HAT)的新型学习框架,用于高性能的基于图像的行人重识别。为此,我们首先提出深度监督聚合(DSA)以循环聚合来自 CNN 主干的分层特征。借助多粒度监督,DSA 能增强用于行人检索的多尺度特征,这与先前方法截然不同。随后,我们引入基于 Transformer 的特征校准(TFC),将低层细节信息作为高层语义信息的全局先验进行整合。所提 TFC 插入至各层分层特征中,带来显著的性能提升。据我们所知,本工作是首个结合 CNN 与 Transformer 优势用于基于图像的行人重识别。在四个大规模 Re-ID 基准上的综合实验表明,我们的方法优于若干最先进方法。代码发布于 https://github.com/AI-Zhpp/HAT。
引用
@article{arxiv.2107.05946,
title = {HAT: Hierarchical Aggregation Transformers for Person Re-identification},
author = {Guowen Zhang and Pingping Zhang and Jinqing Qi and Huchuan Lu},
journal= {arXiv preprint arXiv:2107.05946},
year = {2021}
}
备注
This work has been accepted by ACM International Conference on Multimedia 2021