知识蒸馏中继承正则化的可解模型
机器学习
2022-11-11 v2 无序系统与神经网络
神经与进化计算
摘要
近年来,神经网络迁移学习的经验性成功激发了人们对其核心性质获得理论理解的日益浓厚的兴趣。知识蒸馏(KD)——即利用较大神经网络的输出训练较小神经网络——是迁移学习一个尤其有趣的案例。本工作中,我们引入一个统计物理框架,可对浅层神经网络中知识蒸馏(KD)的性质进行解析刻画。将分析聚焦于一个展现非平凡泛化鸿沟的可解模型,我们研究了KD的有效性。我们得以表明,通过KD,较大教师模型的正则化性质可被较小学生模型继承,且由此产生的泛化性能与教师的最优性紧密相关并受其限制。最后,我们分析了在所考察KD设定中可能出现的双下降现象。
引用
@article{arxiv.2012.00194,
title = {Solvable Model for Inheriting the Regularization through Knowledge Distillation},
author = {Luca Saglietti and Lenka Zdeborová},
journal= {arXiv preprint arXiv:2012.00194},
year = {2022}
}