基于原型对比学习的 CLIP 微调用于目标重识别
计算机视觉与模式识别
2026-01-15 v3
摘要
本工作旨在适配大规模预训练视觉-语言模型(如对比语言-图像预训练(CLIP)),以提升目标重识别(Re-ID)在不同监督设定下的性能。尽管提示学习已使近期名为 CLIP-ReID 的工作取得可观性能,但由于 ReID 任务中缺乏语义标签,提示学习的内在机制与必要性仍不清楚。本工作中,我们首先分析提示学习在 CLIP-ReID 中的作用并指出其局限。基于调研,我们提出一种简单而有效的方法将 CLIP 适配于有监督目标 Re-ID。我们的方法直接使用原型对比学习(PCL)损失微调 CLIP 的图像编码器,省去了提示学习的需求。在行人与车辆 Re-ID 数据集上的实验结果表明,相较 CLIP-ReID,我们的方法具有竞争力。此外,我们将基于 PCL 的 CLIP 微调方法扩展至无监督场景,取得了当前最优性能。代码见 https://github.com/RikoLi/PCL-CLIP。
引用
@article{arxiv.2310.17218,
title = {Prototypical Contrastive Learning-based CLIP Fine-tuning for Object Re-identification},
author = {Jiachen Li and Xiaojin Gong},
journal= {arXiv preprint arXiv:2310.17218},
year = {2026}
}