中文

半监督基于文本的行人搜索

计算机视觉与模式识别 2024-04-30 v1

摘要

基于文本的行人搜索(TBPS)旨在根据自然语言描述从大型图像库中检索特定行人的图像。现有方法依赖大量标注的图像-文本数据在全监督学习下取得令人满意的性能。这在实践中提出了重大挑战,因为从监控视频中获取行人图像相对容易,而获取标注文本则很困难。本文开创性地探索了半监督设置下的TBPS,其中只有有限数量的行人图像带有文本描述,而大多数图像没有标注。我们提出了一种基于生成-检索的两阶段基本解决方案,用于半监督TBPS。生成阶段通过应用图像描述模型为未标注图像生成伪文本来丰富标注数据。随后,检索阶段使用增强数据进行全监督检索学习。重要的是,考虑到伪文本对检索学习的噪声干扰,我们提出了一种噪声鲁棒的检索框架,增强了检索模型处理噪声数据的能力。该框架整合了两个关键策略:混合补丁-通道掩码(PC-Mask)来改进模型架构,以及噪声引导的渐进训练(NP-Train)来增强训练过程。PC-Mask在补丁级和通道级对输入数据进行掩码,以防止过拟合噪声监督。NP-Train引入了一种基于伪文本噪声水平的渐进训练计划,以促进噪声鲁棒学习。在多个TBPS基准上的大量实验表明,所提出的框架在半监督设置下取得了有前景的性能。

关键词

引用

@article{arxiv.2404.18106,
  title  = {Semi-supervised Text-based Person Search},
  author = {Daming Gao and Yang Bai and Min Cao and Hao Dou and Mang Ye and Min Zhang},
  journal= {arXiv preprint arXiv:2404.18106},
  year   = {2024}
}

备注

13 pages