迈向统一文本行人检索:一个大规模多属性与多语言搜索基准
计算机视觉与模式识别
2023-08-15 v4 多媒体
摘要
本文引入一个用于文本行人检索的大规模多属性与语言搜索数据集,称为 MALS,并探索一次性对属性识别与图文匹配任务进行预训练的可行性。具体而言,MALS 包含 1,510,330 个图文对,约为主流 CUHK-PEDES 的 37.5 倍,且所有图像均标注了 27 个属性。考虑到隐私问题与标注成本,我们利用现成的扩散模型生成该数据集。为验证从生成数据中学习的可行性,我们提出了一种新的联合属性提示学习与文本匹配学习(APTM)框架,考虑了属性与文本之间的共享知识。顾名思义,APTM 包含一个属性提示学习流和一个文本匹配学习流。(1)属性提示学习利用属性提示进行图像-属性对齐,从而增强文本匹配学习。(2)文本匹配学习促进细粒度细节上的表征学习,进而提升属性提示学习。大量实验验证了在 MALS 上预训练的有效性,通过 APTM 在三个具有挑战性的真实世界基准上取得了最先进的检索性能。具体而言,APTM 在 CUHK-PEDES、ICFG-PEDES 和 RSTPReid 数据集上分别以明显优势取得 +6.96%、+7.68% 和 +16.95% 的 Recall@1 准确率一致提升。
引用
@article{arxiv.2306.02898,
title = {Towards Unified Text-based Person Retrieval: A Large-scale Multi-Attribute and Language Search Benchmark},
author = {Shuyu Yang and Yinan Zhou and Yaxiong Wang and Yujiao Wu and Li Zhu and Zhedong Zheng},
journal= {arXiv preprint arXiv:2306.02898},
year = {2023}
}