面向知识蒸馏的自适应显式知识传递
计算机视觉与模式识别
2024-09-06 v2 人工智能
摘要
基于逻辑的知识蒸馏(KD)相较于基于特征的 KD 更具成本效益,但常常表现出性能不佳。最近的研究表明,通过有效地将教师模型对非目标类别的概率分布(即“隐式(暗)知识”)传递给学生模型,可提高 KD 的性能。通过梯度分析,我们首先展示了这实际上是一种自适应控制隐式知识学习的方式。随后,我们提出了一种新的损失函数,使学生模型能够以自适应方式学习显式知识(即教师对目标类别的置信度)以及隐式知识。此外,我们提出将分类和蒸馏任务分离,以实现有效的蒸馏和类别间关系建模。实验结果表明,所提出的方法称为自适应显式知识传递(AEKT)的方法,在 CIFAR-100 和 ImageNet 数据集上相较于最先进的 KD 方法实现了性能提升。
引用
@article{arxiv.2409.01679,
title = {Adaptive Explicit Knowledge Transfer for Knowledge Distillation},
author = {Hyungkeun Park and Jong-Seok Lee},
journal= {arXiv preprint arXiv:2409.01679},
year = {2024}
}
备注
19 pages, 5 figures