中文

重生神经网络

机器学习 2024-03-05 v2 人工智能 机器学习

摘要

知识蒸馏 (KD) 包括将“知识”从一个机器学习模型(教师模型)转移到另一个模型(学生模型)。通常,教师模型是具有强大性能的高容量模型,而学生模型更紧凑。通过转移知识,人们希望在不牺牲太多性能的情况下受益于学生模型的紧凑性。我们从一个新的角度研究 KD:我们不是压缩模型,而是训练参数与教师模型完全相同的学生模型。令人惊讶的是,这些重生网络 (BANs) 在计算机视觉和语言建模任务上都显著优于其教师模型。我们基于 DenseNets 的 BANs 实验通过验证误差展示了在 CIFAR-10 (3.5%) 和 CIFAR-100 (15.5%) 数据集上的最优性能。附加实验探讨了两种蒸馏目标:(i) 教师最大值置信度加权 (CWTM) 和 (ii) 置换预测的暗知识 (DKPP)。这两种方法阐明了 KD 的基本组成部分,展示了教师模型输出对预测类和非预测类的影响。

关键词

引用

@article{arxiv.1805.04770,
  title  = {Born Again Neural Networks},
  author = {Tommaso Furlanello and Zachary C. Lipton and Michael Tschannen and Laurent Itti and Anima Anandkumar},
  journal= {arXiv preprint arXiv:1805.04770},
  year   = {2024}
}

备注

Published @ICML 2018