中文

标签噪声下自蒸馏的理解

机器学习 2023-02-01 v1 人工智能 机器学习

摘要

自蒸馏(SD)是指先训练一个“教师”模型,然后利用其预测来训练一个具有“相同”架构的“学生”模型的过程。具体而言,学生的目标函数为 (ξ(教师预测,学生预测)+(1ξ)(给定标签,学生预测))\big(\xi*\ell(\text{教师预测}, \text{学生预测}) + (1-\xi)*\ell(\text{给定标签}, \text{学生预测})\big),其中 \ell 为某损失函数,ξ\xi 为某参数 [0,1]\in [0,1]。经验上,SD 已在多种设定下被观察到能带来性能提升。本文中,我们在两个带有“噪声标签”的监督学习问题中从理论上刻画了 SD 的作用。我们首先分析正则化线性回归下的 SD,并表明在高标签噪声情形下,最小化估计真值参数期望误差的最优 ξ\xi 值惊人地大于 1。我们通过实验表明,当 50% 或 30% 标签被损坏时,即便对多个分类数据集使用交叉熵损失,ξ>1\xi > 1 也优于 ξ1\xi \leq 1。此外,我们量化了最优 SD 何时优于最优正则化。接着,我们分析了在随机标签损坏的二分类逻辑回归中的 SD,并量化了学生在准确率上优于教师的标签损坏范围。据我们所知,这是针对交叉熵损失的首个此类结果。

关键词

引用

@article{arxiv.2301.13304,
  title  = {Understanding Self-Distillation in the Presence of Label Noise},
  author = {Rudrajit Das and Sujay Sanghavi},
  journal= {arXiv preprint arXiv:2301.13304},
  year   = {2023}
}