重生神经网络
机器学习
2024-03-05 v2 人工智能
机器学习
摘要
知识蒸馏 (KD) 包括将“知识”从一个机器学习模型(教师模型)转移到另一个模型(学生模型)。通常,教师模型是具有强大性能的高容量模型,而学生模型更紧凑。通过转移知识,人们希望在不牺牲太多性能的情况下受益于学生模型的紧凑性。我们从一个新的角度研究 KD:我们不是压缩模型,而是训练参数与教师模型完全相同的学生模型。令人惊讶的是,这些重生网络 (BANs) 在计算机视觉和语言建模任务上都显著优于其教师模型。我们基于 DenseNets 的 BANs 实验通过验证误差展示了在 CIFAR-10 (3.5%) 和 CIFAR-100 (15.5%) 数据集上的最优性能。附加实验探讨了两种蒸馏目标:(i) 教师最大值置信度加权 (CWTM) 和 (ii) 置换预测的暗知识 (DKPP)。这两种方法阐明了 KD 的基本组成部分,展示了教师模型输出对预测类和非预测类的影响。
引用
@article{arxiv.1805.04770,
title = {Born Again Neural Networks},
author = {Tommaso Furlanello and Zachary C. Lipton and Michael Tschannen and Laurent Itti and Anima Anandkumar},
journal= {arXiv preprint arXiv:1805.04770},
year = {2024}
}
备注
Published @ICML 2018