教师宠儿:理解与缓解蒸馏中的偏差
机器学习
2021-07-09 v2
摘要
知识蒸馏(knowledge distillation)被广泛用作借助复杂教师模型的预测来提升相对简单的学生模型性能的手段。若干工作表明蒸馏能显著提升学生的整体性能;然而,这些增益在所有数据子群上是否均匀?本文表明蒸馏可能损害某些子群上的性能,例如关联样本较少的类别。我们将此行为归因于教师分布所犯的错误被学生模型传递并放大。为缓解该问题,我们提出在教师影响较不可靠的子群上软化其影响的技术。在若干图像分类基准上的实验表明,这些对蒸馏的修改在保持整体准确率提升的同时,还确保了子群性能的改善。
引用
@article{arxiv.2106.10494,
title = {Teacher's pet: understanding and mitigating biases in distillation},
author = {Michal Lukasik and Srinadh Bhojanapalli and Aditya Krishna Menon and Sanjiv Kumar},
journal= {arXiv preprint arXiv:2106.10494},
year = {2021}
}
备注
21 pages, 8 figures