中文

X-ReID:面向视频可见红外人员识别的多粒度信息交互

计算机视觉与模式识别 2025-11-26 v2

摘要

大规模视觉语言模型(如CLIP)近期在检索任务中取得了显著成绩,但其在视频基于可见红外人员识别(VVI-ReID)中的潜力基本未被探索。主要挑战在于缩小模态间差距并利用视频序列中的时空信息。为此本文提出一种名为X-ReID的新型跨模态特征学习框架,用于VVI-ReID。具体而言,我们首先提出跨模态原型协作(CPC),以对齐整合来自不同模态的特征,引导网络减少模态差异。随后,设计多粒度信息交互(MII),融合相邻帧的短期相互作用、跨帧的长期信息整合及跨模态特征对齐,以增强时序建模并进一步缩小模态间隙。最后,通过整合多粒度信息,实现稳健的序列级表示。广泛的在两大规模VVI-ReID基准(即HITSZ-VCM和BUPTCampus)上的实验表明,我们的方法优于最先进(SOTA)方法。源码已发布于https://github.com/AsuradaYuci/X-ReID。

关键词

引用

@article{arxiv.2511.17964,
  title  = {X-ReID: Multi-granularity Information Interaction for Video-Based Visible-Infrared Person Re-Identification},
  author = {Chenyang Yu and Xuehu Liu and Pingping Zhang and Huchuan Lu},
  journal= {arXiv preprint arXiv:2511.17964},
  year   = {2025}
}

备注

Accepted by AAAI2026. More modifications may be performed