通过基于部件的跨模态对应关系提高基于文本的人搜索
计算机视觉与模式识别
2025-01-03 v1 机器学习
摘要
基于文本的人搜索是指查找与给定自然语言文本描述最相关的人员图像的任务。这一任务的主要挑战在于目标图像与文本查询之间存在较大的鸿沟,这使得建立对应关系并区分不同人员的细微差异变得困难。为解决这一挑战,我们引入了一个高效的编码器-解码器模型,从而提取出从粗到细的嵌入向量,这些嵌入向量在两种模态之间进行语义对齐,而无需监督进行对齐。还有一项挑战是仅凭人员 ID 作为监督来捕捉细粒度信息,而类似身体部位的不同个体会被视为不同,这是由于缺乏部件级监督所致。为针对这一问题,我们提出了一种新型排序损失,称为基于常见性的间隔排序损失,该损失量化了每个身体部位的常见程度,并在学习细粒度身体部位细节时加以反映。结果表明,我们的方法可在三个公开基准数据集上取得最佳成绩。
引用
@article{arxiv.2501.00318,
title = {Improving Text-based Person Search via Part-level Cross-modal Correspondence},
author = {Jicheol Park and Boseung Jeong and Dongwon Kim and Suha Kwak},
journal= {arXiv preprint arXiv:2501.00318},
year = {2025}
}