借鉴过往:经验集成知识蒸馏
计算机视觉与模式识别
2022-02-28 v1 机器学习
摘要
传统的知识蒸馏将预训练教师网络的“暗知识”迁移到学生网络,而忽略了教师训练过程中的知识,我们称之为教师的经验。然而,在现实教育场景中,学习经验往往比学习结果更为重要。在这项工作中,我们提出了一种新颖的知识蒸馏方法,通过整合教师的经验进行知识迁移,名为经验集成知识蒸馏(EEKD)。我们从教师模型的训练过程中均匀保存适量中间模型,然后通过集成技术整合这些中间模型的知识。在知识迁移过程中,使用自注意力模块自适应地为不同中间模型分配权重。我们探讨了构建 EEKD 在中间模型的质量、权重和数量方面的三条原则。一个令人惊讶的结论是,强大的集成教师不一定能产生强大的学生。在 CIFAR-100 和 ImageNet 上的实验结果表明,EEKD 优于主流知识蒸馏方法并达到了最先进水平。特别是,EEKD 在节省训练成本的前提下甚至超越了标准集成蒸馏。
引用
@article{arxiv.2202.12488,
title = {Learn From the Past: Experience Ensemble Knowledge Distillation},
author = {Chaofei Wang and Shaowei Zhang and Shiji Song and Gao Huang},
journal= {arXiv preprint arXiv:2202.12488},
year = {2022}
}
备注
Under review