中文

MaskCLIP:掩码自蒸馏推进对比语言-图像预训练

计算机视觉与模式识别 2023-04-11 v2

摘要

本文提出一个简单而有效的框架 MaskCLIP,其将新提出的掩码自蒸馏引入对比语言-图像预训练。掩码自蒸馏的核心思想是将完整图像的表示蒸馏到从掩码图像预测的表示。这种引入带来两个重要好处。首先,掩码自蒸馏面向局部 patch 表示学习,这与聚焦于文本相关表示的视觉-语言对比形成互补。其次,从训练目标视角看,掩码自蒸馏也与视觉-语言对比一致,因为二者都利用视觉编码器进行特征对齐,从而能够学习获得来自语言间接监督的局部语义。我们提供了专门设计的实验与全面分析以验证这两点好处。对称地,我们也将局部语义监督引入文本分支,进一步提升了预训练性能。通过大量实验,我们表明 MaskCLIP 在应用于各类具有挑战性的下游任务时,在线性探测、微调和零样本性能上以语言编码器为指导取得了优越结果。代码将于 \url{https://github.com/LightDXY/MaskCLIP} 发布。

关键词

引用

@article{arxiv.2208.12262,
  title  = {MaskCLIP: Masked Self-Distillation Advances Contrastive Language-Image Pretraining},
  author = {Xiaoyi Dong and Jianmin Bao and Yinglin Zheng and Ting Zhang and Dongdong Chen and Hao Yang and Ming Zeng and Weiming Zhang and Lu Yuan and Dong Chen and Fang Wen and Nenghai Yu},
  journal= {arXiv preprint arXiv:2208.12262},
  year   = {2023}
}

备注

CVPR 2023, code is available at https://github.com/LightDXY/MaskCLIP