基于扩散模型的可见光-红外行人重识别合成数据生成
计算机视觉与模式识别
2025-03-18 v1
摘要
模型性能与训练数据的丰富程度密切相关。在可见光-红外行人重识别(VI-ReID)任务中,在各种相机和模态下收集和标注每个个体的大规模图像是繁琐、耗时、昂贵且必须遵守数据保护法规的,这在满足数据集需求方面构成了严峻挑战。当前研究调查了生成合成数据作为在实地收集真实数据的高效且确保隐私的替代方案。然而,一种专门针对VI-ReID模型的数据合成技术尚未被探索。本论文提出了一种新颖的数据生成框架——基于扩散的VI-ReID数据扩展(DiVE),通过解耦身份与模态,自动获取大量保持身份的RGB-IR配对图像,以提升VI-ReID模型的性能。具体而言,身份表示从共享同一ID的一组样本中获取,而图像的模态则通过在模态特定数据上微调Stable Diffusion(SD)来学习。DiVE将文本驱动图像合成扩展为保持身份的RGB-IR多模态图像合成。该方法通过直接将合成数据纳入ReID模型训练,显著降低了数据收集和标注成本。实验表明,由DiVE生成的合成数据上训练的VI-ReID模型始终展现出显著提升。特别是,最先进方法CAJ在使用合成图像训练后,在LLCM数据集上的mAP相比基线提升了约9%。代码:https://github.com/BorgDiven/DiVE
引用
@article{arxiv.2503.12472,
title = {Diffusion-based Synthetic Data Generation for Visible-Infrared Person Re-Identification},
author = {Wenbo Dai and Lijing Lu and Zhihang Li},
journal= {arXiv preprint arXiv:2503.12472},
year = {2025}
}
备注
AAAI 2025