中文

用于无监督基于视频的可见光-红外行人重识别的因果引导对齐

计算机视觉与模式识别 2026-04-20 v1

摘要

VVI-ReID 是全天候监控的一项关键技术,其中时间信息提供了静态图像之外的额外线索。然而,现有方法严重依赖带有昂贵跨模态标注的完全监督学习,限制了可扩展性。为了解决这一问题,我们研究了 VVI-ReID 的无监督学习 (USL-VVI-ReID),该方法直接从未标记的视频片段中学习身份判别性表示。使用通用预训练编码器将基于图像的 USL-VI-ReID 方法直接扩展到该设置会导致次优性能。此类编码器存在弱身份判别力和强模态偏差,导致严重的模态内身份混淆以及可见光和红外模态之间明显的聚类粒度不平衡。这些问题共同降低了伪标签的可靠性,并阻碍了有效的跨模态对齐。为了应对这些挑战,我们提出了一种因果引导对齐 (CBA) 框架,该框架显式地利用了固有的视频先验。首先,我们引入了因果干预预热 (CIW),它通过利用时间身份一致性和跨模态身份一致性来执行序列级因果干预,以抑制由模态和运动引起的虚假相关性,同时保留与身份相关的语义,从而为无监督聚类产生更干净的表示。其次,我们提出了原型引导不确定性细化 (PGUR),它采用由粗到细的对齐策略来解决跨模态粒度不匹配问题,在具有不确定性感知监督的可靠可见光原型的指导下重新组织欠聚类的红外表示。在 HITSZ-VCM 和 BUPTCampus 基准上的大量实验表明,当扩展到 USL-VVI-ReID 设置时,CBA 显著优于现有的 USL-VI-ReID 方法。

关键词

引用

@article{arxiv.2604.15631,
  title  = {Causal Bootstrapped Alignment for Unsupervised Video-Based Visible-Infrared Person Re-Identification},
  author = {Shuang Li and Jiaxu Leng and Changjiang Kuang and Mingpi Tan and Yu Yuan and Xinbo Gao},
  journal= {arXiv preprint arXiv:2604.15631},
  year   = {2026}
}

备注

Submit to IEEE TIFS