CLIP-KD:一项关于CLIP模型蒸馏的实证研究
计算机视觉与模式识别
2024-05-08 v2
摘要
对比语言-图像预训练(CLIP)已成为一种有前景的语言监督视觉预训练框架。本文旨在由大型教师CLIP模型监督蒸馏小型CLIP模型。我们提出了若干蒸馏策略,包括关系、特征、梯度和对比范式,以检验CLIP知识蒸馏(KD)的有效性。我们展示仅使用均方误差损失的特征模仿出奇地有效。此外,教师与学生编码器之间的交互式对比学习对性能提升同样有效。我们解释CLIP-KD的成功可归因于最大化教师与学生间的特征相似性。该统一方法被应用于蒸馏在CC3M+12M上训练的若干学生模型。CLIP-KD在零样本ImageNet分类与跨模态检索基准上持续优于学生CLIP模型。当使用在Laion-400M上预训练的ViT-L/14作为教师时,CLIP-KD在ViT-B/16和ResNet-50上分别取得57.5%和55.4%的零样本ImageNet top-1准确率,相较无KD的原始CLIP分别超出20.5%和20.1%。我们的代码发布于https://github.com/winycg/CLIP-KD。
引用
@article{arxiv.2307.12732,
title = {CLIP-KD: An Empirical Study of CLIP Model Distillation},
author = {Chuanguang Yang and Zhulin An and Libo Huang and Junyu Bi and Xinqiang Yu and Han Yang and Boyu Diao and Yongjun Xu},
journal= {arXiv preprint arXiv:2307.12732},
year = {2024}
}
备注
CVPR-2024