理解数据增强对知识蒸馏的影响
计算与语言
2023-05-23 v1
摘要
知识蒸馏(KD)需要充足的数据以将知识从大规模教师模型迁移到小规模学生模型。因此,数据增强已被广泛用于缓解特定场景下数据的短缺。经典的增强技术,如同义词替换和 k-近邻,最初是为微调设计的。为避免严重的语义偏移并保留任务特定标签,这些方法倾向于仅改变很小比例的词元(例如,改变 10% 词元通常是微调的最佳选择)。然而,此类数据增强方法对知识蒸馏是次优的,因为教师模型可提供标签分布且对语义偏移更具容忍度。我们首先观察到 KD 偏好尽可能多的数据,这与微调中数据过多不会获得更多性能不同。由于改变更多词元会导致更多语义偏移,我们使用被改变词元的比例来反映语义偏移程度。接着我们发现 KD 偏好具有比微调(改变 10% 词元)更大语义偏移程度的增强数据(例如,改变 30% 词元通常是 KD 的最佳选择)。此外,我们的发现表明较小的数据集偏好更大程度,直到出现分布外问题(例如,少于 10k 输入的数据集可能偏好 50% 程度,多于 100k 输入的数据集可能偏好 10% 程度)。我们的工作揭示了微调与知识蒸馏之间数据增强偏好差异,并鼓励学界探索 KD 专用的数据增强方法。
引用
@article{arxiv.2305.12565,
title = {Understanding the Effect of Data Augmentation on Knowledge Distillation},
author = {Ziqi Wang and Chi Han and Wenxuan Bao and Heng Ji},
journal= {arXiv preprint arXiv:2305.12565},
year = {2023}
}
备注
14 pages, 8 tables, 5 figures