中文

基于邻近数据生成的对比 Transformer 学习用于文本行人检索

计算机视觉与模式识别 2023-11-16 v1

摘要

给定一个描述性文本查询,文本行人检索(TBPS)旨在从图像库中检索最佳匹配的目标行人。这种跨模态检索任务由于显著的模态鸿沟、细粒度差异以及标注数据不足而极具挑战性。为了更好地对齐两种模态,大多数现有工作侧重于引入复杂的网络结构和辅助任务,这些方法复杂且难以实现。在本文中,我们提出了一种简单而有效的双 Transformer 模型用于文本行人检索。通过利用难样本感知对比学习策略,我们的模型在无需任何针对局部特征对齐或侧信息的特殊设计的情况下达到了最先进的性能。此外,我们提出了一种邻近数据生成(PDG)模块,用于自动生成更多样化的数据以进行跨模态训练。PDG 模块首先引入基于文本到图像扩散模型的自动生成算法,该算法在原始样本邻近空间中生成新的文本-图像对样本。然后在训练期间结合近似文本生成和特征级混合增强以进一步加强数据多样性。PDG 模块能在很大程度上保证所生成样本的合理性,这些样本直接用于训练而无需任何人工检查以剔除噪声。它显著提升了我们模型的性能,为此类细粒度视觉-语言任务面临的数据不足问题提供了可行方案。在两个流行的 TBPS 任务数据集(即 CUHK-PEDES 和 ICFG-PEDES)上的大量实验表明,所提方法明显优于最先进的方法,例如在 CUHK-PEDES 上 Top1、Top5、Top10 分别提升 3.88%、4.02%、2.92%。代码将发布于 https://github.com/HCPLab-SYSU/PersonSearch-CTLG

关键词

引用

@article{arxiv.2311.09084,
  title  = {Contrastive Transformer Learning with Proximity Data Generation for Text-Based Person Search},
  author = {Hefeng Wu and Weifeng Chen and Zhibin Liu and Tianshui Chen and Zhiguang Chen and Liang Lin},
  journal= {arXiv preprint arXiv:2311.09084},
  year   = {2023}
}

备注

Accepted by IEEE T-CSVT