中文

ComKD-CLIP:对比语言-图像预训练模型的全面知识蒸馏

计算机视觉与模式识别 2024-08-22 v3

摘要

对比语言-图像预训练(CLIP)模型通过对比学习技术在图像与文本语义信息集成方面表现出色,在各种多模态任务中取得了显著性能。然而,大型 CLIP 模型的部署在资源受限环境中受到阻碍,而较小模型往往无法达到实际应用所需的性能基准。在本文中,我们提出了一种新方法 ComKD-CLIP:对比语言-图像预训练模型的全面知识蒸馏,旨在将大型教师 CLIP 模型的知识全面蒸馏到较小的学生模型中,以显著减少参数的同时确保可比性能。ComKD-CLIP 由两个关键机制组成:图像特征对齐(IFAlign)和教育注意力(EduAttention)。IFAlign 使学生模型提取的图像特征与教师模型提取的图像特征紧密匹配,使学生能够学习教师提取图像特征的知识。EduAttention 探索教师模型提取的文本特征与学生模型提取的图像特征之间的交叉关系,使学生模型学习教师如何集成文本-图像特征。此外,ComKD-CLIP 可利用教师模型的文本-图像特征融合结果来精炼从 IFAlign 和 EduAttention 中蒸馏的知识,确保学生模型准确吸收教师的知识。在 11 个数据集上进行的广泛实验证明了所提方法的优越性。

关键词

引用

@article{arxiv.2408.04145,
  title  = {ComKD-CLIP: Comprehensive Knowledge Distillation for Contrastive Language-Image Pre-traning Model},
  author = {Yifan Chen and Xiaozhen Qiao and Zhe Sun and Xuelong Li},
  journal= {arXiv preprint arXiv:2408.04145},
  year   = {2024}
}

备注

update