用自知识蒸馏扩展标签平滑正则化
机器学习
2020-09-14 v1 机器学习
摘要
受标签平滑正则化(LSR)与知识蒸馏(KD)之间强相关性的启发,我们提出一种算法 LsrKD,通过将 LSR 方法扩展到 KD 机制并采用更软的温度来实现训练提升。随后我们用教师修正(TC)方法改进 LsrKD,该方法在均匀分布教师中手动为正确类别设定一个较大的恒定比例。为进一步提升 LsrKD 性能,我们开发了一种称为记忆回放知识蒸馏(MrKD)的自蒸馏方法,提供知识型教师以替换 LsrKD 中的均匀分布教师。MrKD 方法对当前模型输出分布与其在训练轨迹上副本的输出分布之间的 KD 损失进行惩罚。通过防止模型学习偏离其历史输出分布空间过远,MrKD 能稳定学习并找到更鲁棒的最小值。我们的实验表明,LsrKD 能持续以零成本提升 LSR 性能,尤其在若干 LSR 无效的深度神经网络上。此外,MrKD 能显著改善单模型训练。实验结果证实 TC 可帮助 LsrKD 和 MrKD 提升训练,尤其在它们失效的网络上。总体而言,LsrKD、MrKD 及其 TC 变体可与 LSR 方法相当或优于之,表明这些 KD 方法的广泛适用性。
引用
@article{arxiv.2009.05226,
title = {Extending Label Smoothing Regularization with Self-Knowledge Distillation},
author = {Ji-Yue Wang and Pei Zhang and Wen-feng Pang and Jie Li},
journal= {arXiv preprint arXiv:2009.05226},
year = {2020}
}