SLaM:面向无标签样本蒸馏的学生标签混合方法
机器学习
2023-06-12 v2
摘要
利用无标签样本进行知识蒸馏是一种强大的训练范式,可在标注数据有限但能获取大量无标签数据的应用中生成紧凑轻量的学生模型。在此设定下,大型教师模型为无标签数据集生成“软”伪标签,随后用于训练学生模型。尽管该方法在多种应用中取得成功,其缺陷在于教师伪标签常含噪声,导致学生性能受损。本文提出一种用于无标签样本知识蒸馏的规范性方法,称为学生标签混合(Student-Label Mixing, SLaM),并通过在多个标准基准上评估表明其持续优于先前方法。最后,我们证明 SLaM 具备理论保证;在此过程中,我们给出了一种改进随机分类噪声下带间隔半空间学习最佳已知样本复杂度的算法,并对所谓“前向损失调整”方法提供了首个收敛性分析。
引用
@article{arxiv.2302.03806,
title = {SLaM: Student-Label Mixing for Distillation with Unlabeled Examples},
author = {Vasilis Kontonis and Fotis Iliopoulos and Khoa Trinh and Cenk Baykal and Gaurav Menghani and Erik Vee},
journal= {arXiv preprint arXiv:2302.03806},
year = {2023}
}