中文

如你所喜:基于神经元选择性迁移的知识蒸馏

计算机视觉与模式识别 2017-12-20 v2 机器学习 神经与进化计算

摘要

尽管深度神经网络已在各种应用中展现出非凡能力,但其优越性能是以高存储与计算成本为代价的。因此,神经网络的加速与压缩近来备受关注。知识迁移(Knowledge Transfer, KT)旨在通过从更大的教师模型迁移知识来训练更小的学生网络,是流行解决方案之一。本文中,我们提出一种新颖的知识迁移方法,将其视为分布匹配问题。特别地,我们匹配教师与学生网络间神经元选择性模式(neuron selectivity patterns)的分布。为实现此目标,我们通过最小化这些分布间的最大均值差异(Maximum Mean Discrepancy, MMD)度量设计了一个新的KT损失函数。结合原始损失函数,我们的方法能显著提升学生网络性能。我们在多个数据集上验证了方法的有效性,并进一步将其与其他KT方法结合以探索最佳可能结果。最后但同样重要的是,我们将模型微调至其他任务如目标检测。结果同样令人鼓舞,证实了所学特征的可迁移性。

关键词

引用

@article{arxiv.1707.01219,
  title  = {Like What You Like: Knowledge Distill via Neuron Selectivity Transfer},
  author = {Zehao Huang and Naiyan Wang},
  journal= {arXiv preprint arXiv:1707.01219},
  year   = {2017}
}