中文

基于变换教师匹配的知识蒸馏

机器学习 2024-03-11 v2 计算机视觉与模式识别

摘要

作为连接 logit 匹配与概率分布匹配的技术,温度缩放在知识蒸馏 (KD) 中扮演着关键角色。传统上,KD 中对教师模型的 logit 和学生模型的 logit 均应用温度缩放。受近期一些工作的启发,本文中我们放弃在学生侧应用温度缩放,并系统地研究了由此产生的 KD 变体,称之为变换教师匹配 (TTM)。通过将温度缩放重新解释为概率分布的幂变换,我们表明与原始 KD 相比,TTM 在其目标函数中具有一个固有的 R\'enyi 熵项,作为额外的正则化项。大量实验结果表明,得益于这种固有正则化,TTM 训练出的学生模型比原始 KD 具有更好的泛化能力。为了进一步增强学生模型匹配教师模型幂变换概率分布的能力,我们向 TTM 中引入了样本自适应加权系数,提出了一种名为加权 TTM (WTTM) 的新型蒸馏方法。综合实验表明,尽管 WTTM 很简单,但它很有效,在 TTM 的基础上有所改进,并达到了 SOTA 的准确率性能。我们的源代码可在 https://github.com/zkxufo/TTM 获取。

关键词

引用

@article{arxiv.2402.11148,
  title  = {Knowledge Distillation Based on Transformed Teacher Matching},
  author = {Kaixiang Zheng and En-Hui Yang},
  journal= {arXiv preprint arXiv:2402.11148},
  year   = {2024}
}

备注

Published as a conference paper at ICLR 2024