三思而后行:通过学习一致的跨模态公共流形改进基于文本的人物检索
计算机视觉与模式识别
2022-09-15 v1 信息检索
多媒体
摘要
基于文本的人物检索的核心问题是如何弥合多模态数据之间的异质鸿沟。许多先前的方法遵循\textbf{跨模态分布共识预测(CDCP)}方式,设计学习潜在公共流形映射范式。当将某一特定模态的分布特征映射到公共流形时,对立模态的特征分布完全不可见。也就是说,如何实现跨模态分布共识从而将多模态特征嵌入并对齐到所构建的跨模态公共流形中,完全依赖于模型自身的经验,而非实际情况。使用此类方法,多模态数据不可避免地无法在公共流形中良好对齐,最终导致次优的检索性能。为克服这一\textbf{CDCP困境},我们提出一种称为LBUL的新算法,用于为基于文本的人物检索学习一致跨模态公共流形(CM)。正如一句中国俗语所言,我们方法的核心思想是“三思而后行”,即\textbf{Look Before yoU Leap(LBUL)}。LBUL的公共流形映射机制包含一个观察步骤和一个跃迁步骤。与基于CDCP的方法相比,LBUL在将某一特定模态的数据嵌入CM之前考虑视觉与文本两种模态的分布特征,以实现更稳固的跨模态分布共识,从而获得更优的检索精度。我们在两个基于文本的人物检索数据集CUHK-PEDES和RSTPReid上评估了所提方法。实验结果表明,所提LBUL优于先前方法并达到了最先进的性能。
引用
@article{arxiv.2209.06209,
title = {Look Before You Leap: Improving Text-based Person Retrieval by Learning A Consistent Cross-modal Common Manifold},
author = {Zijie Wang and Aichun Zhu and Jingyi Xue and Xili Wan and Chao Liu and Tian Wang and Yifeng Li},
journal= {arXiv preprint arXiv:2209.06209},
year = {2022}
}
备注
Accepted on ACM MM '22. arXiv admin note: text overlap with arXiv:2209.05773