知识蒸馏的高维分析:弱到强的泛化与规模定律
机器学习
2025-02-28 v2 机器学习
摘要
越来越多的机器学习场景依赖于知识蒸馏,即使用替代模型的输出作为标签来监督目标模型的训练。本文在两个设置下,对该过程进行精细刻画:(i) 模型迁移,其中替代模型为任意模型;(ii) 分布迁移,其中替代模型是基于外部分布数据执行经验风险最小化的解。在这两种情况下,我们都通过样本量和数据分布下的非渐近界限,对目标模型的精确风险进行表征。结果表明,确定了最优替代模型的形式,揭示了在数据依赖性方式上丢弃弱特征的收益与局限。在弱到强 (W2S) 泛化的语境下,这可解释为:(i) 使用替代模型作为弱模型的 W2S 训练可在相同数据预算下显著优于使用强标签训练;但 (ii) 无法提升数据规模定律。我们在数值实验中验证了结果,既适用于无特征回归,也适用于神经网络架构。
引用
@article{arxiv.2410.18837,
title = {High-dimensional Analysis of Knowledge Distillation: Weak-to-Strong Generalization and Scaling Laws},
author = {M. Emrullah Ildiz and Halil Alperen Gozeten and Ege Onur Taga and Marco Mondelli and Samet Oymak},
journal= {arXiv preprint arXiv:2410.18837},
year = {2025}
}