图像编码器的零样本蒸馏:如何有效利用合成数据
计算机视觉与模式识别
2024-04-26 v1
摘要
多模态基础模型如 CLIP 展示了惊人的零样本能力。然而,由于其参数数量大和推理时间长,其在资源受限环境中的应用受到限制。虽然已有方法通过缩放整个 CLIP 架构来应对,但我们专注于训练较小规模的图像编码器,这足以实现高效的零样本分类。使用合成数据进行蒸馏表示从大型教师模型提取特征的做法已显示出在few-shot 和线性探针性能方面的潜力。然而,我们发现该方法在使用对比损失时在真正的零样本设置下却失败了。我们识别出利用虚假特征是导致合成数据与真实数据之间泛化能力差的根本原因。然而,通过使用基于图像特征的 L2 蒸馈损失,我们缓解了这些问题,并训练出在四个特定领域数据集上实现与 ViT-B/32 教师模型在DataCompXL上训练的零样本性能相当的学生模型,同时参数数量最多可减少 92%。
引用
@article{arxiv.2404.16637,
title = {Zero-Shot Distillation for Image Encoders: How to Make Effective Use of Synthetic Data},
author = {Niclas Popp and Jan Hendrik Metzen and Matthias Hein},
journal= {arXiv preprint arXiv:2404.16637},
year = {2024}
}