DLCR: 一种用于换装行人重识别的基于扩散的生成式数据扩展框架
计算机视觉与模式识别
2024-11-27 v2
摘要
随着生成式扩散模型近期展现出的强大能力,一个开放的研究问题是这些模型生成的图像是否可用于学习更好的视觉表征。虽然这种生成式数据扩展可能足以应对较简单的视觉任务,但我们探索了其在更困难的判别任务上的功效:换装行人重识别 (CC-ReID)。CC-ReID 旨在匹配出现在非重叠摄像头中的人员,即使他们在不同摄像头间更换了衣物。当前的 CC-ReID 模型不仅受限于现有 CC-ReID 数据集中有限的服装多样性,而且生成保留重要个人特征以供准确识别的额外数据也是一个挑战。为解决此问题,我们提出 DLCR,一种利用预训练扩散模型和大语言模型 (LLM) 准确生成不同服装个体多样化图像的新型数据扩展框架。我们为五个基准 CC-ReID 数据集 (PRCC、CCVID、LaST、VC-Clothes 和 LTCC) 生成额外数据,将其服装多样性提高 10 倍,生成图像总计超过 210 万张。DLCR 采用基于扩散的文本引导修复,以 LLM 构建的服装提示为条件,生成仅修改主体衣物同时保留其可识别个人特征的合成数据。借助这一海量数据增强,我们引入了两种新策略——渐进式学习和测试时预测细化——分别减少训练时间并进一步提升 CC-ReID 性能。在 PRCC 数据集上,我们通过使用 DLCR 生成的数据训练 CAL(一种先前的最先进 (SOTA) 方法),获得了 11.3% 的巨大 top-1 准确率提升。我们在此公开发布代码和各数据集的生成数据:https://github.com/CroitoruAlin/dlcr。
引用
@article{arxiv.2411.07205,
title = {DLCR: A Generative Data Expansion Framework via Diffusion for Clothes-Changing Person Re-ID},
author = {Nyle Siddiqui and Florinel Alin Croitoru and Gaurav Kumar Nayak and Radu Tudor Ionescu and Mubarak Shah},
journal= {arXiv preprint arXiv:2411.07205},
year = {2024}
}
备注
Published in WACV 2025