中文

面向学生表现的教师网络训练用于知识蒸馏

机器学习 2024-05-10 v2 人工智能

摘要

如何为知识蒸馏进行教师训练仍是一个开放问题。人们广泛观察到,性能最佳的教师在学生表现上未必最佳,这表明当前教师训练实践与理想教师训练策略之间存在根本差异。为弥补这一差距,我们借助经验风险最小化(ERM)探索训练一个面向学生表现的教师的可行性。我们的分析受到近期发现的启发,即知识蒸馏的有效性取决于教师逼近训练输入真实标签分布的能力。我们从理论上证明,只要学习器网络的特征提取器是Lipschitz连续且对特征变换鲁棒的,ERM最小化器就能逼近训练数据的真实标签分布。基于我们的理论,我们提出一种教师训练方法SoTeacher,其将Lipschitz正则化与一致性正则化纳入ERM。在基准数据集上使用多种知识蒸馏算法与师生对进行的实验证实,SoTeacher能一致地提升学生准确率。

关键词

引用

@article{arxiv.2206.06661,
  title  = {Toward Student-Oriented Teacher Network Training For Knowledge Distillation},
  author = {Chengyu Dong and Liyuan Liu and Jingbo Shang},
  journal= {arXiv preprint arXiv:2206.06661},
  year   = {2024}
}

备注

ICLR 2024; poster link https://drive.google.com/file/d/1K7OWk95cOVhXpTbvrjO8wn9783Wu0Ag4/view?usp=sharing