中文

CLIPSelf:视觉 Transformer 自蒸馏用于开放词汇密集预测

计算机视觉与模式识别 2024-01-25 v2

摘要

包括目标检测与图像分割在内的开放词汇密集预测任务已因对比语言-图像预训练(CLIP)的成功而取得进展。CLIP 模型,尤其是融合视觉 transformer(ViTs)的模型,在零样本图像分类中展现出显著的泛化能力。然而,当将 CLIP 的视觉-语言对齐从全局图像表示迁移到局部区域表示以用于开放词汇密集预测任务时,CLIP ViTs 受到从完整图像到局部图像区域的领域偏移影响。本文中,我们深入分析了 CLIP 模型中的区域-语言对齐,这对于下游开放词汇密集预测任务至关重要。随后,我们提出一种名为 CLIPSelf 的方法,其在无需任何区域-文本对的情况下,将 CLIP ViT 的图像级识别能力适配到局部图像区域。CLIPSelf 通过将其密集特征图中提取的区域表示与对应图像裁剪的图像级表示对齐,使 ViTs 能够自蒸馏。借助增强的 CLIP ViTs,我们在多个基准上的开放词汇目标检测、语义分割和全景分割任务中取得了新的最先进性能。模型和代码发布于 https://github.com/wusize/CLIPSelf。

关键词

引用

@article{arxiv.2310.01403,
  title  = {CLIPSelf: Vision Transformer Distills Itself for Open-Vocabulary Dense Prediction},
  author = {Size Wu and Wenwei Zhang and Lumin Xu and Sheng Jin and Xiangtai Li and Wentao Liu and Chen Change Loy},
  journal= {arXiv preprint arXiv:2310.01403},
  year   = {2024}
}