中文

知识蒸馏:一位耐心且一致的好教师

计算机视觉与模式识别 2022-06-22 v2 人工智能 机器学习

摘要

在计算机视觉领域,实现最先进性能的大规模模型与实际应用中可负担得起的模型之间存在着日益增大的差距。在本文中,我们解决了这一问题,并显著缩小了这两类模型之间的差距。在我们整个实证研究中,我们的目标不一定是要提出一种新方法,而是努力确定一种稳健且有效的方案,使最先进的大规模模型在实践中可负担。我们证明,当正确执行时,知识蒸馏可以成为一种强大的工具,用于在不损害性能的前提下缩减大型模型的规模。特别地,我们揭示了某些隐式的设计选择可能会极大地影响蒸馏的有效性。我们的关键贡献是明确识别了这些先前文献中未阐明的设计选择。我们通过全面的实证研究支撑我们的发现,在广泛的视觉数据集上展示了引人注目的结果,特别是获得了用于 ImageNet 的最先进 ResNet-50 模型,其实现了 82.8% 的 top-1 准确率。

关键词

引用

@article{arxiv.2106.05237,
  title  = {Knowledge distillation: A good teacher is patient and consistent},
  author = {Lucas Beyer and Xiaohua Zhai and Amélie Royer and Larisa Markeeva and Rohan Anil and Alexander Kolesnikov},
  journal= {arXiv preprint arXiv:2106.05237},
  year   = {2022}
}

备注

Lucas, Xiaohua, Am\'elie, Larisa, and Alex contributed equally; CVPR 2022