ABKD:通过 $\alpha$-$\beta$-散度在知识蒸馏中寻求概率质量的合理分配
机器学习
2025-06-04 v3
摘要
知识蒸馏(KD)通过最小化大型教师模型与小型学生模型输出分布之间的散度,将知识从前者迁移至后者,通常使用正向 Kullback-Leibler 散度(FKLD)或反向 KLD(RKLD)。由于教师分布相比独热标签提供了更广泛的监督信息,它已成为一种有效的训练范式。我们发现,KD 的核心挑战在于平衡两种模式集中效应:\textbf{\textit{硬度集中}}效应,指聚焦于误差较大的模式;以及\textbf{\textit{置信度集中}}效应,指聚焦于学生置信度高的模式。通过对梯度更新过程中概率如何重新分配的分析,我们观察到这两种效应在 FKLD 和 RKLD 中是纠缠在一起的,但形式极端。具体来说,两者在 FKLD 中都太弱,导致学生无法集中于目标类别。相反,两者在 RKLD 中都太强,导致学生过度强调目标类别,而忽略了来自教师的更广泛的分布信息。为了解决这种不平衡,我们提出了 ABKD,一个基于 --散度的通用框架。我们的理论结果表明,ABKD 提供了 FKLD 和 RKLD 之间的平滑插值,实现了这些效应之间的有效权衡。在 17 个语言/视觉数据集上,使用 12 种师生设置进行的大量实验证实了其有效性。代码可在 https://github.com/ghwang-s/abkd 获取。
引用
@article{arxiv.2505.04560,
title = {ABKD: Pursuing a Proper Allocation of the Probability Mass in Knowledge Distillation via $\alpha$-$\beta$-Divergence},
author = {Guanghui Wang and Zhiyong Yang and Zitai Wang and Shi Wang and Qianqian Xu and Qingming Huang},
journal= {arXiv preprint arXiv:2505.04560},
year = {2025}
}
备注
ICML 2025 Spotlight