通过标签修正和数据选择改进知识蒸馏
机器学习
2024-04-08 v1 人工智能
摘要
知识蒸馏(KD)已成为模型压缩领域中广泛使用的技术,旨在将大型教师模型的知识迁移到轻量级学生模型,以实现高效的网络开发。除了真实标签的监督外,原始KD方法将教师模型的预测作为软标签来监督学生模型的训练。基于原始KD,研究人员开发了各种方法来进一步提高学生模型的性能。然而,以往的方法很少考虑教师模型监督的可靠性。来自错误预测的监督可能会误导学生模型的训练。因此,本文从两个方面解决这个问题:标签修正(纠正错误的监督)和数据选择(选择适当的样本进行蒸馏,以减少错误监督的影响)。在前者中,我们提出利用真实标签来纠正教师的不准确预测。在后者中,我们引入一种数据选择技术,选择适合由教师监督的训练样本,从而在一定程度上减少错误预测的影响。实验结果表明了我们提出方法的有效性,并表明我们的方法可以与其他蒸馏方法结合,提高它们的性能。
引用
@article{arxiv.2404.03693,
title = {Improve Knowledge Distillation via Label Revision and Data Selection},
author = {Weichao Lan and Yiu-ming Cheung and Qing Xu and Buhua Liu and Zhikai Hu and Mengke Li and Zhenghua Chen},
journal= {arXiv preprint arXiv:2404.03693},
year = {2024}
}