中文

基于 Transformer 的多粒度特征用于无监督行人重识别

计算机视觉与模式识别 2022-11-23 v1

摘要

从卷积神经网络(CNN)中提取的多粒度特征已在有监督行人重识别(Re-ID)任务中展现出强大的判别能力。受此启发,本文探究从纯 transformer 网络中提取多粒度特征的方法,以解决无标签但更具挑战性的无监督 Re-ID 问题。为此,我们基于改进的 Vision Transformer (ViT) 构建了双分支网络架构。每个分支输出的局部 token 被重塑并均匀划分为多条条纹以生成部件级特征,而两个分支的全局 token 被平均以产生全局特征。进一步,基于离线-在线关联相机感知代理(O2CAP,一种性能最优的无监督 Re-ID 方法),我们针对全局与部件级特征定义了离线及在线对比学习损失以进行无监督学习。在三个行人 Re-ID 数据集上的大量实验表明,所提方法以显著优势超越最先进的无监督方法,大幅缩小了与有监督方法的差距。代码即将发布于 https://github.com/RikoLi/WACV23-workshop-TMGF。

关键词

引用

@article{arxiv.2211.12280,
  title  = {Transformer Based Multi-Grained Features for Unsupervised Person Re-Identification},
  author = {Jiachen Li and Menglin Wang and Xiaojin Gong},
  journal= {arXiv preprint arXiv:2211.12280},
  year   = {2022}
}

备注

Accepted by WACVW 2023, 3rd Workshop on Real-World Surveillance: Applications and Challenges