中文

通过移植最后一层进行去偏蒸馏

机器学习 2023-02-23 v1 计算机与社会

摘要

深度模型易于学习虚假关联,即便在后处理阶段也是如此。我们仔细考察了知识蒸馏——一种流行的模型压缩后处理技术——并发现即便教师模型已去偏,使用有偏训练数据进行蒸馏仍会产生有偏的学生模型。为解决此问题,我们提出了一种简单的知识蒸馏算法,称为DeTT(通过教师移植去偏)。受近期关于神经网络最后一层在去偏中起压倒性重要作用的观察启发,DeTT直接将教师的最后一层移植到学生模型。其余层通过匹配学生和教师的特征图输出来蒸馏,其中样本被重新加权以减轻数据集偏差。重要的是,DeTT不依赖于后处理阶段通常不可用的偏差相关属性的大量标注。在我们的实验中,DeTT成功对学生模型去偏,在最差组准确率上持续优于基线方法。

关键词

引用

@article{arxiv.2302.11187,
  title  = {Debiased Distillation by Transplanting the Last Layer},
  author = {Jiwoon Lee and Jaeho Lee},
  journal= {arXiv preprint arXiv:2302.11187},
  year   = {2023}
}