知识蒸馏中“好”的数据增强是什么——一个统计视角
计算机视觉与模式识别
2023-02-23 v3 人工智能
机器学习
神经与进化计算
摘要
知识蒸馏(KD)是一种利用教师模型指导学生模型的通用神经网络训练方法。现有工作主要从网络输出侧研究KD(例如试图设计更好的KD损失函数),而极少从输入侧理解它。尤其是,它与数据增强(DA)的相互作用尚未被充分理解。在本文中,我们提出:为何某些DA方案(如CutMix)在KD中本质上远优于其他方案?KD中什么是“好”的DA?我们从统计视角的调研表明,好的DA方案应降低师生交叉熵的协方差。进一步提出了一个实用指标——教师平均概率的标准差(T. stddev),并从经验上给予了充分论证。除理论理解外,我们还引入了一种新的基于熵的数据混合DA方案CutMixPick,以进一步增强CutMix。广泛的实证研宄支持我们的主张,并展示了如何仅通过在知识蒸馏中使用更好的DA方案来获取可观的性能提升。
引用
@article{arxiv.2012.02909,
title = {What Makes a "Good" Data Augmentation in Knowledge Distillation -- A Statistical Perspective},
author = {Huan Wang and Suhas Lohit and Mike Jones and Yun Fu},
journal= {arXiv preprint arXiv:2012.02909},
year = {2023}
}
备注
Camera Ready of NeurIPS'22. Code: https://github.com/MingSun-Tse/Good-DA-in-KD