中文

基于Transformer的人员重识别自监督预训练

计算机视觉与模式识别 2021-11-24 v1

摘要

基于Transformer的监督预训练在人员重识别(ReID)中取得优异性能。然而,由于ImageNet与ReID数据集间的域差距,因其强大的数据拟合能力,通常需更大数据预训练集(如ImageNet-21K)以提升性能。为应对该挑战,本工作分别从数据与模型结构角度缓解预训练与ReID数据集间的差距。我们首先研究以Vision Transformer(ViT)在无标签人员图像(LUPerson数据集)上自监督学习(SSL)预训练,并经验发现其在ReID任务上显著超越ImageNet监督预训练模型。为进一步缩小域差距并加速预训练,提出灾难性遗忘分数(CFS)以评估预训练与微调数据间的差距。基于CFS,通过采样接近下游ReID数据的相关数据并过滤预训练集中不相关数据来选取子集。对于模型结构,提出名为基于IBN的卷积干(ICS)的ReID特定模块,通过学习更多不变特征来弥合域差距。我们进行了大量实验,在监督学习、无监督域适应(UDA)与无监督学习(USL)设定下微调预训练模型。我们成功将LUPerson数据集缩减至50%且无性能下降。最终,我们在Market-1501与MSMT17上达到最先进性能。例如,我们的ViT-S/16在Market1501上于监督/UDA/USL ReID分别取得91.3%/89.9%/89.6% mAP准确率。代码与模型将发布于https://github.com/michuanhaohao/TransReID-SSL。

关键词

引用

@article{arxiv.2111.12084,
  title  = {Self-Supervised Pre-Training for Transformer-Based Person Re-Identification},
  author = {Hao Luo and Pichao Wang and Yi Xu and Feng Ding and Yanxin Zhou and Fan Wang and Hao Li and Rong Jin},
  journal= {arXiv preprint arXiv:2111.12084},
  year   = {2021}
}