中文

CPCL:用于弱监督文本行人检索的跨模态原型对比学习

计算机视觉与模式识别 2025-08-19 v3

摘要

弱监督文本行人检索旨在利用文本描述检索目标行人的图像,而不依赖身份标注,这更具挑战性且更实用。主要挑战在于类内差异,包括模态内特征变化和跨模态语义鸿沟。先前的工作专注于实例级样本,忽略了每个人固有的且不变的原型特征。为此,我们提出了一种跨模态原型对比学习(CPCL)方法。在实践中,CPCL 引入 CLIP 模型用于弱监督文本行人检索,将视觉和文本实例映射到共享的潜在空间中。随后,提出的原型多模态记忆(PMM)模块通过混合跨模态匹配(HCM)模块,以多对多映射的方式捕捉属于同一人的图像 - 文本对的异质模态之间的关联。此外,异常值伪标签挖掘(OPLM)模块进一步从每种模态中区分有价值的异常值样本,通过挖掘图像 - 文本对之间的隐含关系来增强更可靠聚类的创建。我们在流行的弱监督文本行人检索基准上进行了广泛的实验,验证了 CPCL 的有效性和泛化能力。

关键词

引用

@article{arxiv.2401.10011,
  title  = {CPCL: Cross-Modal Prototypical Contrastive Learning for Weakly Supervised Text-based Person Retrieval},
  author = {Xinpeng Zhao and Yanwei Zheng and Chuanlin Lan and Xiaowei Zhang and Bowen Huang and Jibin Yang and Dongxiao Yu},
  journal= {arXiv preprint arXiv:2401.10011},
  year   = {2025}
}

备注

9 pages, 6 figures, under peer review