中文

面向深度学习中集成、知识蒸馏与自蒸馏的理解

机器学习 2023-02-16 v3 神经与进化计算 最优化与控制 机器学习

摘要

我们形式化地研究深度学习模型的集成如何提升测试准确率,以及如何使用知识蒸馏将集成的优越性能蒸馏到单个模型中。我们考虑具有挑战性的情形:集成仅仅是具有相同架构的若干独立训练神经网络的输出平均,这些网络使用相同算法在同一数据集上训练,仅因初始化所用的随机种子不同而有所区别。我们表明,深度学习中的集成/知识蒸馏与传统学习理论(如 boosting 或 NTK,即神经正切核)工作方式非常不同。为恰当理解它们,我们发展了一种理论,表明当数据具有我们称之为“多视角(multi-view)”的结构时,独立训练的神经网络集成可证明地提升测试准确率,并且这种优越的测试准确率也可通过训练单个模型去匹配集成的输出而非真实标签而可证明地蒸馏到单个模型中。我们的结果以与传统定理完全不同的方式阐明了深度学习中集成的工作机制,以及“暗知识(dark knowledge)”如何隐藏在集成的输出中并可用于蒸馏。最后,我们证明自蒸馏也可视为隐式地结合集成与知识蒸馏以提升测试准确率。

关键词

引用

@article{arxiv.2012.09816,
  title  = {Towards Understanding Ensemble, Knowledge Distillation and Self-Distillation in Deep Learning},
  author = {Zeyuan Allen-Zhu and Yuanzhi Li},
  journal= {arXiv preprint arXiv:2012.09816},
  year   = {2023}
}

备注

v2/V3 polishes writing