中文

通过知识蒸馏与自训练提升CLIP鲁棒性

计算机视觉与模式识别 2023-09-20 v1 机器学习 多媒体

摘要

本文在无监督学习背景下考察多模态计算机视觉模型CLIP(对比语言-图像预训练)的鲁棒性。主要目标有二:一是评估CLIP的鲁棒性,二是探索增强其鲁棒性的策略。为此,我们引入一种名为LP-CLIP的新方法。该技术通过在CLIP编码结构顶部加入线性探测层来蒸馏CLIP特征。这一新增层利用CLIP生成的伪标签并结合自训练策略进行训练。LP-CLIP技术提供了一种无需标注即可增强CLIP鲁棒性的可行途径。通过利用简单的线性探测层,我们旨在提升模型抵御现实场景中常见各类不确定性与挑战的能力。重要的是,我们的方法不依赖标注数据,这在标注数据稀缺或获取成本高昂的情况下尤为宝贵。我们所提方法在多个数据集上相较监督技术以SOTA结果提升了CLIP的鲁棒性。

关键词

引用

@article{arxiv.2309.10361,
  title  = {Improving CLIP Robustness with Knowledge Distillation and Self-Training},
  author = {Clement Laroudie and Andrei Bursuc and Mai Lan Ha and Gianni Franchi},
  journal= {arXiv preprint arXiv:2309.10361},
  year   = {2023}
}