面向可见光-红外行人重识别的 CLIP 驱动语义发现网络
计算机视觉与模式识别
2024-01-15 v2
摘要
可见光-红外行人重识别(VIReID)主要处理跨模态行人图像的身份匹配问题。由于可见光与红外图像之间存在模态差异,跨模态身份匹配带来了显著挑战。认识到行人外观的高层语义(如性别、体型和衣着风格)在不同模态间保持一致,本文旨在通过向视觉特征注入高层语义来弥合模态差异。鉴于 CLIP 能够感知与视觉表征对应的高层语义信息,我们探索了 CLIP 在 VIReID 领域的应用。为此,我们提出了一种 CLIP 驱动的语义发现网络(CSDN),该网络由模态特定提示学习器、语义信息集成(SII)和高层语义嵌入(HSE)组成。具体而言,考虑到语言描述中因模态差异而产生的多样性,我们设计了双模态可学习文本令牌,分别捕获可见光和红外图像的模态私有语义信息。此外,认识到不同模态间语义细节的互补性,我们集成了来自双模态语言描述的文本特征,以获得全面的语义。最后,我们在跨模态的集成文本特征与视觉特征之间建立联系。这一过程将丰富的高层语义信息嵌入到视觉表征中,从而促进视觉表征的模态不变性。通过在多个广泛使用的基准数据集上的实验评估,我们提出的 CSDN 相较于现有方法的有效性和优越性已得到证实。代码将发布于 https://github.com/nengdong96/CSDN。
引用
@article{arxiv.2401.05806,
title = {CLIP-Driven Semantic Discovery Network for Visible-Infrared Person Re-Identification},
author = {Xiaoyan Yu and Neng Dong and Liehuang Zhu and Hao Peng and Dapeng Tao},
journal= {arXiv preprint arXiv:2401.05806},
year = {2024}
}