中文

理解多次自蒸馏的收益

机器学习 2024-07-08 v1 机器学习

摘要

自蒸馏是一种特殊类型的知识蒸馏,其中学生模型与教师模型具有相同的体系结构。尽管使用相同的体系结构和相同的训练数据,自蒸馏仍被经验观察到可以提升性能,尤其是在多次应用时效果更为显著。对于这种过程,存在一个关键问题:通过多次自蒸馏可以实现多少收益?为探讨这种相对收益,我们提出采用简单而典型的线性回归任务进行研究。我们的分析表明,多步骤自蒸馏的剩余风险相较于单一步骤自蒸馏可显著提升,提升幅度可达输入维数 d。在 UCI 数据集存储库中的回归任务实验结果表明,所学模型的风险 (MSE) 可降低最高可达 47%。

关键词

引用

@article{arxiv.2407.04600,
  title  = {Understanding the Gains from Repeated Self-Distillation},
  author = {Divyansh Pareek and Simon S. Du and Sewoong Oh},
  journal= {arXiv preprint arXiv:2407.04600},
  year   = {2024}
}

备注

31 pages, 10 figures