SCMM:基于缝合校准与掩码建模校准跨模态表征以进行文本行人检索
计算机视觉与模式识别
2025-12-09 v8
摘要
文本行人检索(TBPS)旨在利用自然语言描述从大规模图库中检索目标人物图像,这在跨模态表征学习中提出了根本性挑战。现有方法往往难以弥合异构模态之间的语义鸿沟,同时捕捉对于区分视觉相似个体至关重要的细粒度对应关系。为应对这些挑战,我们提出缝合校准与掩码建模(SCMM),这是一个通过互补学习机制校准跨模态表征的统一框架。值得注意的是,SCMM引入了两个新颖组件:一个缝合校准损失,基于文本信息密度利用质量引导的自适应边界动态对齐图像-文本特征;以及一个掩码描述建模损失,通过基于Transformer的掩码预测建立细粒度跨模态对应关系。此外,缝合校准机制实施双向约束,以在共享嵌入空间中有效压缩同身份特征,而掩码建模组件利用跨模态解码器学习词级视觉-文本关系,从而能够区分细微的属性差异。我们的双编码器架构通过仅训练阶段使用解码器的设计,在表征能力与计算效率之间实现了有效平衡。在CUHK-PEDES、ICFG-PEDES和RSTPReID基准上的大量实验表明,SCMM分别取得了73.81%、64.25%和57.35%的Rank1准确率,达到了最先进(SOTA)性能。全面的消融研究验证了每个所提组件的有效性。
引用
@article{arxiv.2304.02278,
title = {SCMM: Calibrating Cross-modal Representations for Text-Based Person Search},
author = {Jing Liu and Donglai Wei and Yang Liu and Sipeng Zhang and Tong Yang and Wei Zhou and Weiping Ding and Victor C. M. Leung},
journal= {arXiv preprint arXiv:2304.02278},
year = {2025}
}
备注
11 pages, 7 figures, 7 tables