CLIP驱动的无衣着特征学习用于换衣人员重识别
计算机视觉与模式识别
2024-06-14 v1
摘要
对比语言-图像预训练(CLIP)在短期人员重识别(Person Re-Identification, ReID)中展现出惊人的性能,由于其能够提取行人高层次语义特征。然而,CLIP 的直接应用于换衣人员重识别(CC-ReID)面临挑战,因为 CLIP 的图像编码器过于关注衣物线索。为此,我们提出了一种 novel 框架,称为 CLIP 驱动的无衣着特征学习(CCAF),用于 CC-ReID。相应地,设计了两个模块:不变特征提示(Invariant Feature Prompting, IFP)和衣物特征最小化(Clothes Feature Minimization, CFM)。这些模块引导模型从原始图像中提取与衣物无关的特征,同时消弱与衣物相关的特征。具体而言,IFP 设计用于从原始图像中提取与衣物无关的细粒度语义特征,由无衣着文本提示指导。这一模块首先在像素级别遮盖原始图像中的衣物,以获得屏蔽图像,然后利用 CLIP 的知识生成无衣着文本提示。随后,它在特征空间中对齐原始图像-文本和原始图像-屏蔽图像,强调与身份相关但与衣物无关的判别性线索。此外,CFM 设计用于检验和弱化图像编码器提取衣物特征的能力。它首先生成对应衣物像素的文本提示。然后,依据这些衣物文本提示,迭代检验和分离衣物特征,最终保留内在的判别性特征。广泛的实验表明,所提出的 CCAF 方法有效,实现了在多个流行 CC-ReID 数据集上达到新的 state-of-the-art 性能,且无需额外的推理时间。
引用
@article{arxiv.2406.09198,
title = {CLIP-Driven Cloth-Agnostic Feature Learning for Cloth-Changing Person Re-Identification},
author = {Shuang Li and Jiaxu Leng and Guozhang Li and Ji Gan and Haosheng chen and Xinbo Gao},
journal= {arXiv preprint arXiv:2406.09198},
year = {2024}
}