VI-Diff:用于单模态标注可见光-红外行人重识别的非配对可见光-红外翻译扩散模型
计算机视觉与模式识别
2023-10-09 v1
摘要
真实场景下的可见光-红外行人重识别(VI-ReID)因跨模态数据标注成本高而面临重大挑战。不同传感相机(如用于良好/较差光照条件的 RGB/IR 相机)使得跨模态识别同一行人成本高且易错。为克服此问题,我们探索使用单模态标注数据完成 VI-ReID 任务,其更具成本效益与实用性。通过仅在一个模态(如可见光图像)中标注行人,并在另一模态(如红外图像)中检索,我们旨在利用非配对图像到图像翻译技术构建包含原始标注数据与模态翻译数据的训练集。本文提出 VI-Diff,一种有效解决可见光-红外行人图像翻译任务的扩散模型。通过充分实验,我们证明 VI-Diff 优于现有扩散与 GAN 模型,使其成为具备单模态标注数据的 VI-ReID 的可行方案。我们的方法可作为单模态标注数据下 VI-ReID 任务的有前景解决方案,并可作为未来研究的良好起点。代码将公开。
引用
@article{arxiv.2310.04122,
title = {VI-Diff: Unpaired Visible-Infrared Translation Diffusion Model for Single Modality Labeled Visible-Infrared Person Re-identification},
author = {Han Huang and Yan Huang and Liang Wang},
journal= {arXiv preprint arXiv:2310.04122},
year = {2023}
}
备注
11 pages, 7 figures