TCMM: 基于ViT标记约束和多尺度记忆库的对比学习用于无监督行人重识别
计算机视觉与模式识别
2025-01-17 v1 人工智能
摘要
本文提出了 ViT 标记约束和多尺度记忆库(TCMM)方法,以解决无监督行人重识别工作中的 patch 噪声和特征不一致性问题。许多优秀的方法使用 ViT 框架获取伪标签和聚类原型,然后进行对比学习训练。然而,ViT 通过执行 patch 嵌入来处理图像,这不可避免地引入 patch 噪声,可能损害行人重识别模型的性能。另一方面,基于记忆库的对比学习方法由于批量大小限制可能导致数据不一致。此外,现有的伪标签方法常常丢弃难以聚类的异常样本。这牺牲了异常样本潜在价值,导致模型的多样性和鲁棒性受限。本文引入了 ViT 标记约束来减轻 patch 噪声对 ViT 架构的损害。提出的多尺度记忆库增强了对异常样本的探索,并保持特征一致性。实验结果表明,我们的方法在常见基准上实现了最好的性能。该项目可在 https://github.com/andy412510/TCMM 获取。
引用
@article{arxiv.2501.09044,
title = {TCMM: Token Constraint and Multi-Scale Memory Bank of Contrastive Learning for Unsupervised Person Re-identification},
author = {Zheng-An Zhu and Hsin-Che Chien and Chen-Kuo Chiang},
journal= {arXiv preprint arXiv:2501.09044},
year = {2025}
}