蒸馏为何有效:一种统计视角
机器学习
2020-05-22 v1 机器学习
摘要
知识蒸馏是一种通过用复杂“教师”模型获得的标签分布替换简单“学生”模型的独热训练标签来提升其性能的技术。尽管这一简单方法已被证明广泛有效,一个基本问题仍未解决:蒸馏为何有帮助?在本文中,我们提出一种解释该问题的蒸馏统计视角,并建立了与极端多类检索技术的新颖联系。我们的核心观察是,教师模型试图估计潜在的(贝叶斯)类概率函数。在此基础上,我们在学生的目标函数中确立了一个基本的偏差-方差权衡:这量化了这些类概率的近似知识如何显著辅助学习。最后,我们展示了蒸馏如何补充现有的极端多类检索负挖掘技术,并提出了一种结合这些思想的统一目标函数。
引用
@article{arxiv.2005.10419,
title = {Why distillation helps: a statistical perspective},
author = {Aditya Krishna Menon and Ankit Singh Rawat and Sashank J. Reddi and Seungyeon Kim and Sanjiv Kumar},
journal= {arXiv preprint arXiv:2005.10419},
year = {2020}
}