中文

CLIP4VI-ReID: 利用CLIP语义桥实现可见--红外行人重识别的模态共享表征学习

计算机视觉与模式识别 2025-11-14 v1

摘要

本文提出一种新颖的CLIP驱动的模态共享表征学习网络,命名为CLIP4VI-ReID,用于VI-ReID任务,包括文本语义生成(TSG)、红外特征嵌入(IFE)和高层语义对齐(HSA)。具体而言,鉴于自然图像与红外图像之间巨大的物理特性差异,TSG被设计为仅为可见图像生成文本语义,从而实现可见-文本模态的初步对齐。随后,IFE提出利用生成的文本语义对红外图像的特征嵌入进行校正。这一过程将与身份相关的语义注入共享图像编码器中,增强其对红外模态的适应性。此外,借助文本作为桥梁,实现了间接的可见-红外模态对齐。最后,在HSA中建立了高层语义对齐。这一过程确保经微调后的文本语义仅包含身份相关信息,从而实现更精确的跨模态对齐,增强所学模态共享表征的辨识度。大量实验结果表明,所提出的CLIP4VI-ReID在多个广泛使用的VI-ReID数据集上优于其他最新方法。

关键词

引用

@article{arxiv.2511.10309,
  title  = {CLIP4VI-ReID: Learning Modality-shared Representations via CLIP Semantic Bridge for Visible-Infrared Person Re-identification},
  author = {Xiaomei Yang and Xizhan Gao and Sijie Niu and Fa Zhu and Guang Feng and Xiaofeng Qu and David Camacho},
  journal= {arXiv preprint arXiv:2511.10309},
  year   = {2025}
}