中文

基于路径约束优化的知识蒸馏

机器学习 2019-04-22 v1 计算机视觉与模式识别

摘要

基于蒸馏的学习基于这样的假设提升小型化神经网络的性能:教师模型的表示可作为结构化的、相对弱的监督,从而易被小型化模型学习。然而,我们发现收敛的重型模型的表示对于训练小型学生模型仍是一个强约束,这导致一致损失的下界较高。在本工作中,受课程学习启发,我们从课程学习的路径视角考虑知识蒸馏。我们不是用收敛的教师模型监督学生模型,而是用从教师模型在参数空间中所经过路径上选取的一些锚点来监督它,即所谓的路径约束优化(RCO)。我们通过实验证明这一简单操作极大降低了一致损失在知识蒸馏、提示学习和模仿学习中的下界。在 CIFAR100 和 ImageNet 等闭集分类任务上,RCO 分别将知识蒸馏提升了 2.14% 和 1.5%。为评估泛化性,我们还在开集人脸识别任务 MegaFace 上测试了 RCO。

关键词

引用

@article{arxiv.1904.09149,
  title  = {Knowledge Distillation via Route Constrained Optimization},
  author = {Xiao Jin and Baoyun Peng and Yichao Wu and Yu Liu and Jiaheng Liu and Ding Liang and Junjie Yan and Xiaolin Hu},
  journal= {arXiv preprint arXiv:1904.09149},
  year   = {2019}
}