其他标记同样重要:探索视觉Transformer的全局与局部特征用于目标重识别
计算机视觉与模式识别
2024-04-24 v1 多媒体
摘要
目标重识别(Re-ID)旨在从不同地点和时间拍摄的图像中识别和检索特定目标。近年来,随着视觉Transformer(ViT)的发展,目标重识别取得了巨大成功。然而,在Transformer用于目标重识别时,全局-局部关系的影响尚未被充分探索。本文首先探索了ViT全局和局部特征的影响,然后进一步提出了一种新颖的全局-局部Transformer(GLTrans)用于高性能目标重识别。我们发现ViT最后几层的特征已经具有很强的表示能力,并且全局和局部信息可以相互增强。基于这一事实,我们提出了全局聚合编码器(GAE),利用最后几个Transformer层的类别标记,有效学习全面的全局特征。同时,我们提出了局部多层融合(LMF),它利用GAE的全局线索和多层补丁标记来探索判别性的局部表示。大量实验表明,我们提出的方法在四个目标重识别基准上取得了优越的性能。
引用
@article{arxiv.2404.14985,
title = {Other Tokens Matter: Exploring Global and Local Features of Vision Transformers for Object Re-Identification},
author = {Yingquan Wang and Pingping Zhang and Dong Wang and Huchuan Lu},
journal= {arXiv preprint arXiv:2404.14985},
year = {2024}
}
备注
Accepted by CVIU2024. More modifications may be performed