通过知识蒸馏增强CLIP概念嵌入
人工智能
2024-12-10 v2 计算与语言
计算机视觉与模式识别
机器学习
摘要
最近,CLIP已成为多模态上下文中对齐图像和文本的重要模型。然而,研究人员发现CLIP的文本和图像编码器从图文对中提取详细知识的能力存在局限性。为此,本文提出了Knowledge-CLIP,一种通过集成基于Llama 2的新型知识蒸馏(KD)方法来提升CLIP性能的创新方法。我们的方法聚焦于三个关键目标:文本嵌入蒸馏、概念学习和对比学习。首先,文本嵌入蒸馏涉及训练Knowledge-CLIP文本编码器以模仿教师模型Llama 2。其次,概念学习通过对来自Llama 2的文本数据采用离线K-means聚类,为每个图文对分配一个软概念标签,使Knowledge-CLIP能够从这些软概念标签中学习。最后,对比学习对齐文本和图像嵌入。我们的实验结果表明,所提出的模型提升了文本和图像编码器的性能。
引用
@article{arxiv.2412.03513,
title = {Enhancing CLIP Conceptual Embedding through Knowledge Distillation},
author = {Kuei-Chun Kao},
journal= {arXiv preprint arXiv:2412.03513},
year = {2024}
}