中文

CLIP 用于基于文本的人员检索的实证研究

计算机视觉与模式识别 2023-12-22 v2 计算与语言

摘要

基于文本的人员检索(Text-based Person Search, TBPS)旨在利用自然语言描述检索人员图像。近来,对比语言-图像预训练(Contrastive Language Image Pretraining, CLIP)这一通用大型跨模态视觉-语言预训练模型,凭借其强大的跨模态语义学习能力,在各种跨模态下游任务上表现卓越。TPBS 作为一种细粒度跨模态检索任务,也正面临基于 CLIP 的 TBPS 研究的兴起。为探索视觉-语言预训练模型在下游 TBPS 任务中的潜力,本文首次尝试对 CLIP 用于 TBPS 进行全面实证研究,从而向 TBPS 社区贡献一个直观、增量却强劲的 TBPS-CLIP 基线。我们重访 CLIP 下的关键设计考量,包括数据增强与损失函数。具备上述设计及实用训练技巧的模型无需任何复杂模块即可取得令人满意的性能。此外,我们在模型泛化与模型压缩方面对 TBPS-CLIP 进行了探查实验,从多方面证明了 TBPS-CLIP 的有效性。本工作期望提供经验性见解并凸显未来基于 CLIP 的 TBPS 研究。

关键词

引用

@article{arxiv.2308.10045,
  title  = {An Empirical Study of CLIP for Text-based Person Search},
  author = {Min Cao and Yang Bai and Ziyin Zeng and Mang Ye and Min Zhang},
  journal= {arXiv preprint arXiv:2308.10045},
  year   = {2023}
}

备注

Accepted by AAAI 2024. Code is available at https://github.com/Flame-Chasers/TBPS-CLIP