中文

图像重识别:自监督学习与视觉语言学习的融合

计算机视觉与模式识别 2024-07-31 v1

摘要

最近,大规模基于视觉语言预训练模型如 CLIP 在图像重识别 (ReID) 任务中展现出惊人的性能。在本工作中,我们探讨了自监督学习是否能促进 CLIP 用于图像 ReID。具体而言,我们提出了 SVLL-ReID,该方法通过两个训练阶段集成自监督学习和预训练 CLIP,以促进图像 ReID。我们观察到:1) 在第一个训练阶段 incorporating 语言自监督可使可学习文本提示更具辨识度;2) 在第二个训练阶段 incorporating 视觉自监督可使由图像编码器学习的图像特征更具判别性。这些观察表明:1) 第一个阶段的文本提示学习可从语言自监督中受益;2) 第二个阶段的图像特征学习可从视觉自监督中受益。这些收益共同促进了 SVLL-ReID 的性能提升。通过在六个图像 ReID 基准数据集上进行实验(无需任何具体文本标签),我们发现 SVLL-ReID 的整体性能优于现有 SOTA 方法。代码将公开于 https://github.com/BinWangGzhu/SVLL-ReID。

关键词

引用

@article{arxiv.2407.20647,
  title  = {Image Re-Identification: Where Self-supervision Meets Vision-Language Learning},
  author = {Bin Wang and Yuying Liang and Lei Cai and Huakun Huang and Huanqiang Zeng},
  journal= {arXiv preprint arXiv:2407.20647},
  year   = {2024}
}