CPCL:用于弱监督文本行人检索的跨模态原型对比学习
计算机视觉与模式识别
2025-08-19 v3
摘要
弱监督文本行人检索旨在利用文本描述检索目标行人的图像,而不依赖身份标注,这更具挑战性且更实用。主要挑战在于类内差异,包括模态内特征变化和跨模态语义鸿沟。先前的工作专注于实例级样本,忽略了每个人固有的且不变的原型特征。为此,我们提出了一种跨模态原型对比学习(CPCL)方法。在实践中,CPCL 引入 CLIP 模型用于弱监督文本行人检索,将视觉和文本实例映射到共享的潜在空间中。随后,提出的原型多模态记忆(PMM)模块通过混合跨模态匹配(HCM)模块,以多对多映射的方式捕捉属于同一人的图像 - 文本对的异质模态之间的关联。此外,异常值伪标签挖掘(OPLM)模块进一步从每种模态中区分有价值的异常值样本,通过挖掘图像 - 文本对之间的隐含关系来增强更可靠聚类的创建。我们在流行的弱监督文本行人检索基准上进行了广泛的实验,验证了 CPCL 的有效性和泛化能力。
引用
@article{arxiv.2401.10011,
title = {CPCL: Cross-Modal Prototypical Contrastive Learning for Weakly Supervised Text-based Person Retrieval},
author = {Xinpeng Zhao and Yanwei Zheng and Chuanlin Lan and Xiaowei Zhang and Bowen Huang and Jibin Yang and Dongxiao Yu},
journal= {arXiv preprint arXiv:2401.10011},
year = {2025}
}
备注
9 pages, 6 figures, under peer review