蒸馏≈早停?利用各向异性信息检索提取暗知识用于过参数化神经网络
机器学习
2019-10-04 v1 计算机视觉与模式识别
信息论
机器学习
math.IT
摘要
蒸馏是一种将知识从一个模型迁移到另一个模型的方法,并且通常在相同容量下达到更高的准确率。在本文中,我们旨在从理论上理解蒸馏的主要作用所在。我们的答案是“早停”。假设教师网络是过参数化的,我们认为教师网络本质上是通过早停从数据中获取暗知识。这可以由一个新概念——各向异性信息检索(AIR)来论证,即神经网络倾向于先拟合信息性信息,后拟合非信息性信息(包括噪声)。受近期过参数化神经网络理论分析的启发,我们可以通过神经正切核(NTK)的特征空间来刻画AIR。AIR促进了对蒸馏的新理解。基于此,我们进一步利用蒸馏来精炼带噪标签。我们提出了一种自蒸馏算法,顺序地将前一训练轮次网络中的知识蒸馏出来,以避免记忆错误标签。我们还从理论和经验上证明,自蒸馏的好处不止于早停。理论上,我们证明了所提算法在距离意义上收敛到真实标签(针对随机初始化的过参数化神经网络),而先前结果仅关于0-1损失的收敛。该理论结果保证了所学神经网络在训练数据上享有间隔,从而带来更好的泛化。经验上,我们取得了更好的测试准确率,并完全避免了早停,使算法更加用户友好。
引用
@article{arxiv.1910.01255,
title = {Distillation $\approx$ Early Stopping? Harvesting Dark Knowledge Utilizing Anisotropic Information Retrieval For Overparameterized Neural Network},
author = {Bin Dong and Jikai Hou and Yiping Lu and Zhihua Zhang},
journal= {arXiv preprint arXiv:1910.01255},
year = {2019}
}
备注
Accepted by NeurIPS 2019 Workshop on Machine Learning with Guarantees. Submitted to other places