中文

面向文本到图像行人重识别的提示解耦

计算机视觉与模式识别 2024-01-05 v1 人工智能

摘要

文本到图像行人重识别 旨在通过文本描述查询从图像库中检索目标行人。最近,像 CLIP 这样的预训练视觉-语言模型因其强大的语义概念学习能力和丰富的多模态知识而备受关注,并被广泛用于此任务。然而,近期基于 CLIP 的 TIReID 方法通常依赖于对整个网络进行直接微调,以使 CLIP 模型适应 TIReID 任务。尽管这些方法在该主题上表现出有竞争力的性能,但它们是次优的,因为它们需要同时进行领域适应和任务适应。为了解决这个问题,我们尝试在训练阶段将这两个过程解耦。具体而言,我们引入提示微调策略以实现领域适应,并提出了一种两阶段训练方法,将领域适应与任务适应分离。在第一阶段,我们冻结来自 CLIP 的两个编码器,仅专注于优化提示,以缓解 CLIP 原始训练数据与下游任务之间的领域差距。在第二阶段,我们保持提示固定,并微调 CLIP 模型以优先捕获更适合 TIReID 任务的细粒度信息。最后,我们在三个广泛使用的数据集上评估了我们方法的有效性。与直接微调的方法相比,我们的方法取得了显著的改进。

关键词

引用

@article{arxiv.2401.02173,
  title  = {Prompt Decoupling for Text-to-Image Person Re-identification},
  author = {Weihao Li and Lei Tan and Pingyang Dai and Yan Zhang},
  journal= {arXiv preprint arXiv:2401.02173},
  year   = {2024}
}