利用扩散模型合成高效数据用于行人重识别预训练
计算机视觉与模式识别
2024-06-11 v1 人工智能
摘要
现有的行人重识别(Re-ID)方法主要使用ImageNet-1K数据集进行模型初始化,由于巨大的领域差距,这不可避免地导致次优情况。关键挑战之一是构建大规模行人重识别数据集非常耗时。先前的一些工作通过从互联网收集行人图像(例如LUPerson)来解决这个问题,但这种方法难以从未标注、不可控且有噪声的数据中学习。在本文中,我们提出了一种新颖的范式Diffusion-ReID,以基于已知身份高效地增强和生成多样化的图像,而无需任何数据收集和标注成本。从技术上讲,该范式分为两个阶段:生成和过滤。在生成阶段,我们提出了语言提示增强(LPE)以确保输入图像序列与生成图像之间的身份一致性。在扩散过程中,我们提出了一个多样性注入(DI)模块来增加属性多样性。为了使生成的数据具有更高质量,我们应用了一个Re-ID置信度阈值过滤器来进一步去除低质量图像。得益于我们提出的范式,我们首先创建了一个新的大规模行人重识别数据集Diff-Person,该数据集包含来自5,183个身份的超过777K张图像。接下来,我们在我们的Diff-Person上预训练了一个更强的行人重识别骨干网络。在四个行人重识别基准的六种广泛使用的设置下进行了大量实验。与其他预训练和自监督竞争对手相比,我们的方法显示出显著的优越性。
引用
@article{arxiv.2406.06045,
title = {Synthesizing Efficient Data with Diffusion Models for Person Re-Identification Pre-Training},
author = {Ke Niu and Haiyang Yu and Xuelin Qian and Teng Fu and Bin Li and Xiangyang Xue},
journal= {arXiv preprint arXiv:2406.06045},
year = {2024}
}