中文

数据增强对知识蒸馏影响的实证分析

计算机视觉与模式识别 2020-06-11 v2 人工智能 机器学习

摘要

使用经验风险最小化训练的深度学习模型的泛化性能,可通过简单变换或混合样本等数据增强策略得到显著提升。我们尝试实证分析此类策略在蒸馏设置中教师与学生模型间泛化能力传递的影响。我们观察到,若教师模型使用任一混合样本增强策略(如MixUp或CutMix)训练,则从中蒸馏出的学生模型其泛化能力受损。我们假设此类策略限制了模型学习样本特定特征的能力,导致蒸馏过程中监督信号质量下降。我们提出一种新颖的类别区分度度量,定量衡量这种性能上的二分现象,并将其与不同策略在网络隐空间中诱导的判别能力相联系。

关键词

引用

@article{arxiv.2006.03810,
  title  = {An Empirical Analysis of the Impact of Data Augmentation on Knowledge Distillation},
  author = {Deepan Das and Haley Massa and Abhimanyu Kulkarni and Theodoros Rekatsinas},
  journal= {arXiv preprint arXiv:2006.03810},
  year   = {2020}
}