中文

基于 CLIP 的协同知识迁移用于文本行人检索

计算机视觉与模式识别 2024-01-03 v2 人工智能

摘要

文本行人检索(TPR)旨在根据文本查询检索目标人物图像。其主要挑战在于弥合视觉与语言模态之间的巨大鸿沟,尤其是在处理有限的大规模数据集时。本文提出一种用于 TPR 的基于 CLIP 的协同知识迁移(CSKT)方法。具体而言,为探索 CLIP 在输入侧的知识,我们首先提出由文本到图像与图像到文本双向提示及耦合投影构成的双向提示迁移(BPT)模块。其次,设计双适配器迁移(DAT)以在视觉与语言的多头注意力(MHA)输出侧迁移知识。这种协同的双向协作机制促进了早期特征融合,并高效利用了 CLIP 的已有知识。当训练参数仅占整个模型的 7.4% 时,CSKT 在三个基准数据集上优于当前最优方法,展现出卓越的效率、有效性与泛化能力。

关键词

引用

@article{arxiv.2309.09496,
  title  = {CLIP-based Synergistic Knowledge Transfer for Text-based Person Retrieval},
  author = {Yating Liu and Yaowei Li and Zimo Liu and Wenming Yang and Yaowei Wang and Qingmin Liao},
  journal= {arXiv preprint arXiv:2309.09496},
  year   = {2024}
}

备注

ICASSP2024(accepted). minor typos revision compared to version 1 in arxiv