通过全核矩阵迁移改进知识蒸馏
机器学习
2022-03-31 v2 计算机视觉与模式识别
机器学习
摘要
知识蒸馏是深度学习中一种有效的模型压缩方法。给定一个大型模型(即教师模型),其旨在通过从教师模型迁移信息来提升紧凑模型(即学生模型)的性能。已有多种用于蒸馏的信息被研究。近来,若干工作提出迁移样本间的成对相似性以蒸馏相对信息。然而,大多数努力致力于开发不同的相似性度量,而每次迭代仅迁移一个 mini-batch 内样本组成的小矩阵,这对于优化整个数据集上的成对相似性效率低下。本工作中,我们旨在有效迁移全相似性矩阵。主要挑战来自全矩阵规模与样本数成二次关系。为应对该挑战,我们使用 Nystr{"o}m 方法分解原始全矩阵。通过选取适当的地标点,我们的理论分析表明迁移损失可进一步简化。具体而言,我们发现教师与学生间原始全核矩阵的差异可由相应的部分矩阵(仅由原始样本与地标点间相似性构成)的差异很好地界定。与全矩阵相比,部分矩阵规模随样本数线性增长,显著提升了优化效率。在基准数据集上的实证研究表明所提算法的有效性。代码见 \url{https://github.com/idstcv/KDA}。
引用
@article{arxiv.2009.14416,
title = {Improved Knowledge Distillation via Full Kernel Matrix Transfer},
author = {Qi Qian and Hao Li and Juhua Hu},
journal= {arXiv preprint arXiv:2009.14416},
year = {2022}
}
备注
accepted by SDM'22