如何为有效知识蒸馏训练教师模型
机器学习
2024-07-26 v1
摘要
最近的研究表明,知识蒸馏(KD)中的教师作用是为学生提供真实贝叶斯条件概率密度(BCPD)的估计值。值得注意的是,新研究提出,学生的误差率可上界为教师输出与 BCPD 之间的均方误差(MSE)。因此,为提升 KD 的效果,教师应被训练使得其输出在 MSE 意义上接近 BCPD。本文阐明,使用 MSE 损失训练教师模型等价于最小化其输出与 BCPD 之间的 MSE,这符合其核心职责——为学生提供接近 BCPD 的估计。基于此,经过一系列全面实验,我们展示,用 MSE 训练的教师模型取代使用交叉熵损失训练的传统教师,可持续提升学生的准确率,提升幅度可达最高 2.6%。
引用
@article{arxiv.2407.18041,
title = {How to Train the Teacher Model for Effective Knowledge Distillation},
author = {Shayan Mohajer Hamidi and Xizhen Deng and Renhao Tan and Linfeng Ye and Ahmed Hussein Salamah},
journal= {arXiv preprint arXiv:2407.18041},
year = {2024}
}
备注
The paper was accepted at ECCV2024