中文

基于调制-且实例感知的视觉提示学习提升可见-红外行人重识别

计算机视觉与模式识别 2024-06-19 v1 人工智能 多媒体

摘要

可见-红外行人重识别(VI ReID)旨在匹配不同非重叠摄像头视角下的可见和红外图像中相同行人的图像。这两种输入模态包含不变信息(如形状)以及模态特定细节(如颜色)。理想的模型应在训练期间利用这两种模态的有价值信息以增强表征能力。然而,由模态特定信息引起的差距对VI ReID模型处理不同模态输入提出了重大挑战。为此,我们在本工作中引入了调制感知和实例感知视觉提示(MIP)网络,旨在有效利用两者的不变和特定信息以实现识别。具体而言,我们的MIP模型基于transformer架构构建。在该模型中,我们设计了一系列模态特定提示,这些提示能够使模型适应并利用不同模态输入固有的特定信息,从而减少由模态差距引起的干扰,实现更好的识别。此外,我们还利用每个行人特征构建一组实例特定提示。这些定制提示负责动态指导模型适应每个行人实例,从而捕获识别所需的身份级别判别线索。通过在SYSU-MM01和RegDB数据集上的大量实验,评估了我们设计的各个模块的有效性。此外,我们提出的MIP在大多数最先进的方法中性能更佳。

关键词

引用

@article{arxiv.2406.12316,
  title  = {Enhancing Visible-Infrared Person Re-identification with Modality- and Instance-aware Visual Prompt Learning},
  author = {Ruiqi Wu and Bingliang Jiao and Wenxuan Wang and Meng Liu and Peng Wang},
  journal= {arXiv preprint arXiv:2406.12316},
  year   = {2024}
}

备注

Accepyed by ACM International Conference on Multimedia Retrieval (ICMR'24)