用于人员重识别预训练的跨视频身份关联
计算机视觉与模式识别
2024-09-30 v1
摘要
近期研究证明,在从互联网视频中提取的大规模人员图像上进行预训练,是学习更好人员重识别表示的有效方法。然而,这些研究大多局限于实例级或单视频轨迹级的预训练。它们忽略了不同视频中同一人图像间的身份不变性,而这正是人员重识别的关键关注点。为解决这一问题,我们提出了一种跨视频身份关联预训练(CION)框架。CION 定义了一个综合考虑身份内一致性和身份间区分度的噪声概念,通过将其建模为渐进式多级去噪问题,从跨视频图像中寻求身份关联。此外,我们提出了一种身份引导的自蒸馏损失,通过挖掘人员图像内的身份不变性来实现更优的大规模预训练。我们进行了广泛的实验以验证 CION 在效率和性能方面的优越性。CION 在训练样本更少的情况下取得了显著领先的性能。例如,与之前的最先进方法~\cite{ISR} 相比,采用相同 ResNet50-IBN 的 CION 在 Market1501 和 MSMT17 上分别实现了 93.3\% 和 74.3\% 的更高 mAP,而仅使用了 8\% 的训练样本。最后,鉴于 CION 展现出优越的模型无关能力,我们贡献了一个名为 ReIDZoo 的模型库,以满足该领域多样化的研究和应用需求。它包含一系列具有跨结构跨参数的 CION 预训练模型,共计 10 种不同结构的 32 个模型,包括 GhostNet、ConvNext、RepViT、FastViT 等。代码和模型将在 https://github.com/Zplusdragon/CION_ReIDZoo 公开发布。
引用
@article{arxiv.2409.18569,
title = {Cross-video Identity Correlating for Person Re-identification Pre-training},
author = {Jialong Zuo and Ying Nie and Hanyu Zhou and Huaxin Zhang and Haoyu Wang and Tianyu Guo and Nong Sang and Changxin Gao},
journal= {arXiv preprint arXiv:2409.18569},
year = {2024}
}
备注
NeurIPS 2024 Accepted Paper