CLIP-Embed-KD:使用嵌入作为教师的高计算效率知识蒸馏
机器学习
2024-09-02 v1 人工智能
摘要
对比语言-图像预训练(CLIP)已被证明可以改善语言和视觉模型的零样本泛化能力。在本文中,我们扩展了CLIP用于高效知识蒸馏,通过利用嵌入作为教师。典型的知识蒸馏框架需要运行教师模型的前向传播,这在教师模型有数十亿或数万亿参数的情况下通常是不可行的。在这些情况下,仅使用教师模型的嵌入来指导蒸馏可以产生显著的计算节省。我们的初步发现表明,基于CLIP的嵌入知识蒸馏可以在使用9倍更少内存和8倍更少训练时间的情况下,超越全尺度知识蒸馏。代码可在https://github.com/lnairGT/CLIP-Distillation/获取。
引用
@article{arxiv.2404.06170,
title = {CLIP-Embed-KD: Computationally Efficient Knowledge Distillation Using Embeddings as Teachers},
author = {Lakshmi Nair},
journal= {arXiv preprint arXiv:2404.06170},
year = {2024}
}
备注
Short paper - 5 pages; 5 figures