切勿盲目模仿教师:利用扰动损失进行知识蒸馏
机器学习
2023-05-10 v1 计算与语言
摘要
知识蒸馏是一种将知识从大型教师模型迁移到小型学生模型的流行技术。通常,学生通过最小化其输出分布与教师输出分布的KL散度来学习模仿教师。本工作中,我们认为此类学习目标次优,因为教师输出分布与真实标签分布之间存在差异。因此,强迫学生盲目模仿不可靠的教师输出分布会导致较差性能。为此,我们提出一种新颖的知识蒸馏目标PTLoss:首先通过Maclaurin级数表示基于KL的 vanilla 蒸馏损失函数,然后扰动该级数中的首项。该扰动损失隐式地将原始教师转换为一个分布更接近真实标签分布的代理教师。我们建立了此“分布接近性”与学生模型泛化能力之间的理论联系,使我们能够以原则性方式选择PTLoss的扰动系数。在五个数据集上的大量实验表明,PTLoss能显著提升不同规模教师的蒸馏效果。
引用
@article{arxiv.2305.05010,
title = {Do Not Blindly Imitate the Teacher: Using Perturbed Loss for Knowledge Distillation},
author = {Rongzhi Zhang and Jiaming Shen and Tianqi Liu and Jialu Liu and Michael Bendersky and Marc Najork and Chao Zhang},
journal= {arXiv preprint arXiv:2305.05010},
year = {2023}
}
备注
16 pages