中文

非对称温度缩放使更大网络重新具备良好的蒸馏能力

机器学习 2022-10-14 v2

摘要

知识蒸馏(Knowledge Distillation, KD)旨在将一个性能良好的神经网络(教师网络)的知识迁移到一个较弱的网络(学生网络)。一个奇特的现象是,更准确的模型不一定教得更好,且温度调节也无法缓解这种容量不匹配。为解释这一点,我们将 KD 的有效性分解为三部分:正确引导、平滑正则化以及类别可判别性。最后一项描述了教师在 KD 中提供的错误类别概率的区分度。复杂教师往往过度自信,而传统温度缩放限制了类别可判别性的效用,导致错误类别概率的判别性较弱。因此,我们提出非对称温度缩放(Asymmetric Temperature Scaling, ATS),对正确/错误类别分别施加较高/较低的温度。ATS 增大了教师标签中错误类别概率的方差,并使学生尽可能具判别性地掌握错误类别相对于目标类别的绝对亲和度。理论分析与大量实验结果均证明了 ATS 的有效性。基于 Mindspore 开发的演示代码见 https://gitee.com/lxcnju/ats-mindspore,并将在 https://gitee.com/mindspore/models/tree/master/research/cv/ats 提供。

关键词

引用

@article{arxiv.2210.04427,
  title  = {Asymmetric Temperature Scaling Makes Larger Networks Teach Well Again},
  author = {Xin-Chun Li and Wen-Shu Fan and Shaoming Song and Yinchuan Li and Bingshuai Li and Yunfeng Shao and De-Chuan Zhan},
  journal= {arXiv preprint arXiv:2210.04427},
  year   = {2022}
}

备注

Accepted By NeurIPS 2022