中文

即便是教师模型也需要引导:真实标签抑制自蒸馏带来的正则化

机器学习 2021-10-18 v2 机器学习

摘要

知识蒸馏经典上是一种训练过程,其中神经网络在另一网络输出与原目标共同作用下进行训练,以实现架构间的知识迁移。自蒸馏作为网络架构相同的特例,已被观察到能提升泛化精度。本文在核回归设定下考虑自蒸馏的迭代变体,其中每一步同时纳入模型输出与真实标签目标。这使我们能够提供关于自蒸馏中使用加权真实标签目标重要性的首批理论结果。我们关注于用适合蒸馏的加权均方误差目标函数拟合非线性函数到训练数据,并对模型参数施加 2\ell_2 正则化。我们证明,任何通过自蒸馏获得的此类函数均可直接作为初始拟合的函数来计算,且无限步蒸馏所得优化问题与原问题相同但正则化被放大。此外,我们给出每步加权参数的最优选择的闭式解,并展示如何为深度学习高效估计该加权参数,相比网格搜索显著降低了计算需求。

关键词

引用

@article{arxiv.2102.13088,
  title  = {Even your Teacher Needs Guidance: Ground-Truth Targets Dampen Regularization Imposed by Self-Distillation},
  author = {Kenneth Borup and Lars N. Andersen},
  journal= {arXiv preprint arXiv:2102.13088},
  year   = {2021}
}

备注

To be published at NeurIPS 2021; 21 pages, 14 figures