标签噪声下自蒸馏的理解
机器学习
2023-02-01 v1 人工智能
机器学习
摘要
自蒸馏(SD)是指先训练一个“教师”模型,然后利用其预测来训练一个具有“相同”架构的“学生”模型的过程。具体而言,学生的目标函数为 ,其中 为某损失函数, 为某参数 。经验上,SD 已在多种设定下被观察到能带来性能提升。本文中,我们在两个带有“噪声标签”的监督学习问题中从理论上刻画了 SD 的作用。我们首先分析正则化线性回归下的 SD,并表明在高标签噪声情形下,最小化估计真值参数期望误差的最优 值惊人地大于 1。我们通过实验表明,当 50% 或 30% 标签被损坏时,即便对多个分类数据集使用交叉熵损失, 也优于 。此外,我们量化了最优 SD 何时优于最优正则化。接着,我们分析了在随机标签损坏的二分类逻辑回归中的 SD,并量化了学生在准确率上优于教师的标签损坏范围。据我们所知,这是针对交叉熵损失的首个此类结果。
引用
@article{arxiv.2301.13304,
title = {Understanding Self-Distillation in the Presence of Label Noise},
author = {Rudrajit Das and Sujay Sanghavi},
journal= {arXiv preprint arXiv:2301.13304},
year = {2023}
}