通过自知识蒸馏正则化类间预测
机器学习
2020-04-08 v2 计算机视觉与模式识别
机器学习
摘要
具有数百万参数的深度神经网络可能因过拟合而泛化不佳。为缓解该问题,我们提出一种新的正则化方法,其对相似样本间的预测分布进行惩罚。具体而言,我们在训练期间蒸馏相同标签不同样本间的预测分布。这得以通过强制单个网络(即自知识蒸馏)以类级方式产生更有意义且一致的预测,来正则化该单一网络的暗知识(即关于错误预测的知识)。从而,它缓解了过度自信的预测并减小了类内差异。我们在多种图像分类任务上的实验结果表明,这一简单而强大的方法不仅能显著提升现代卷积神经网络的泛化能力,还能改善其校准性能。
引用
@article{arxiv.2003.13964,
title = {Regularizing Class-wise Predictions via Self-knowledge Distillation},
author = {Sukmin Yun and Jongjin Park and Kimin Lee and Jinwoo Shin},
journal= {arXiv preprint arXiv:2003.13964},
year = {2020}
}
备注
Accepted to CVPR 2020. Code is available at https://github.com/alinlab/cs-kd