重新思考知识蒸馏中的中心核对齐
计算机视觉与模式识别
2024-05-01 v4
摘要
知识蒸馏已成为弥合大规模模型与轻量模型之间表示差异的高效方法。主流方法涉及利用适当的度量来最小化教师模型提取的知识与学生模型学习的知识之间的差异或距离。中心核对齐(CKA)被广泛用于衡量表示相似性,并已应用于多种知识蒸馏方法。然而,这些方法复杂且未能揭示CKA的本质,因此未能回答如何正确使用CKA实现简单有效蒸馏的问题。本文首先从理论角度阐述CKA的有效性,将CKA分解为最大均值差异(MMD)的上界和一个常数项。基于此,我们提出了一种新颖的关系中心核对齐(RCKA)框架,该框架实际建立了CKA与MMD之间的联系。此外,我们根据每个任务的特征动态定制CKA的应用,与先前方法相比,计算资源更少但性能相当。在CIFAR-100、ImageNet-1k和MS-COCO上的大量实验表明,我们的方法在几乎所有教师-学生对的图像分类和目标检测任务上达到了最先进的性能,验证了我们方法的有效性。我们的代码可在https://github.com/Klayand/PCKA获取。
引用
@article{arxiv.2401.11824,
title = {Rethinking Centered Kernel Alignment in Knowledge Distillation},
author = {Zikai Zhou and Yunhang Shen and Shitong Shao and Linrui Gong and Shaohui Lin},
journal= {arXiv preprint arXiv:2401.11824},
year = {2024}
}