基于SGD的贝叶斯教师知识蒸馏:理论与指南
机器学习
2026-01-06 v1
摘要
知识蒸馏(KD)是将来自大型教师网络的知识传递给通常较小的学生模型的核心范式,通常通过利用软概率输出实现。尽管KD在众多应用中显示出强大的经验成功,但其理论基础仍只部分被理解。在本工作中,我们从贝叶斯视角对KD进行严格分析,以探讨使用随机梯度下降(SGD)训练的学生的收敛行为。我们研究了两个情景:(i)教师提供确切的贝叶斯类概率(BCPs);(ii)监督使用BCPs的噪声近似值。我们的分析表明,从BCPs学习可实现方差缩减,并与一热监督相比消除邻域项。我们进一步描述了噪声水平如何影响泛化和准确性。受这些见解启发,我们主张使用贝叶斯深度学习模型,这些模型通常能提供改进的BCPs估计,作为KD中的教师。与我们的分析一致,我们在实验中演示了来自贝叶斯教师蒸馏的学生不仅实现更高的准确率(最高可达+4.27%),而且表现出更稳定的收敛(噪声降低最高可达30%),相对于来自确定性教师的学生。
引用
@article{arxiv.2601.01484,
title = {SGD-Based Knowledge Distillation with Bayesian Teachers: Theory and Guidelines},
author = {Itai Morad and Nir Shlezinger and Yonina C. Eldar},
journal= {arXiv preprint arXiv:2601.01484},
year = {2026}
}