PersonViT:面向人员重识别的大规模自监督视觉Transformer
计算机视觉与模式识别
2024-08-21 v2
摘要
人员重识别(ReID)旨在检索非重叠摄像头图像中的相关个体,在公共安全领域具有广泛应用。近年来,随着视觉Transformer(ViT)和自监督学习技术的发展,基于自监督预训练的人员ReID性能得到了显著提升。人员ReID需要提取人体的高度判别性的局部细粒度特征,而传统ViT擅长提取与上下文相关的全局特征,难以聚焦于局部人体特征。为此,本文引入近期出现的掩码图像建模(MIM)自监督学习方法,用于人员ReID,通过结合掩码图像建模和判别式对比学习,在大规模无监督预训练后有效提取高质量的全局与局部特征,再在人员ReID任务上进行监督式微调训练。本文提出的基于ViT的掩码图像建模人员特征提取方法(PersonViT)具有无监督、可扩展和强泛化等优势,克服了监督式人员ReID标注困难的问题,在公开基准数据集(包括MSMT17、Market1501、DukeMTMC-reID和Occluded-Duke)上实现了最先进的效果。PersonViT方法的代码和预训练模型已发布于\url{https://github.com/hustvl/PersonViT},以推动人员ReID领域的进一步研究。
引用
@article{arxiv.2408.05398,
title = {PersonViT: Large-scale Self-supervised Vision Transformer for Person Re-Identification},
author = {Bin Hu and Xinggang Wang and Wenyu Liu},
journal= {arXiv preprint arXiv:2408.05398},
year = {2024}
}