重访知识蒸馏:数据规模的隐藏作用
机器学习
2025-10-20 v1 人工智能
摘要
知识蒸馏(KD)概念描述了从教师模型训练学生模型的过程,是深度学习中广泛采用的技术。然而,蒸馏为何及如何工作仍不明确。以往研究聚焦于两个核心方面:模型规模和泛化。在本工作中,我们在数据规模这第三个维度上研究蒸馏。我们在广泛的数据集、任务和神经网络架构上进行一系列实验,表明蒸馏效果不仅保持,而且在小数据场景中被放大。我们将这一新发现的属性称为蒸馏的数据效率。凭借这一新视角,我们测试了现有KD理论在不同数据规模下的预测能力。我们的结果否定了蒸馈可被理解为标签平滑的假设,进一步支持了暗知识假设。最后,我们分析了目标函数、规模和相对样本数等建模因素对观察现象的影响。最终,本工作揭示了数据规模可能是支撑蒸馏机制的根本且被忽视的变量。
引用
@article{arxiv.2510.15516,
title = {Revisiting Knowledge Distillation: The Hidden Role of Dataset Size},
author = {Giulia Lanzillotta and Felix Sarnthein and Gil Kur and Thomas Hofmann and Bobby He},
journal= {arXiv preprint arXiv:2510.15516},
year = {2025}
}