中文

面向知识蒸馏的保序数据增强

机器学习 2021-07-07 v2 人工智能

摘要

知识蒸馏同时使用真实硬标签与教师模型预测的软标签作为监督。直观上,我们期望软标签与硬标签就其概率顺序而言是一致的。然而,我们发现增强样本中硬标签与软标签之间存在严重的顺序违背。例如,对于增强样本 x=0.7panda+0.3catx=0.7*panda+0.3*cat,我们期望有意义软标签的顺序为 Psoft(pandax)>Psoft(catx)>Psoft(otherx)P_\text{soft}(panda|x)>P_\text{soft}(cat|x)>P_\text{soft}(other|x)。但真实软标签通常违背该顺序,如 Psoft(tigerx)>Psoft(pandax)>Psoft(catx)P_\text{soft}(tiger|x)>P_\text{soft}(panda|x)>P_\text{soft}(cat|x)。我们将此归因于教师泛化能力不佳导致增强样本的预测错误。实证上,我们发现此类违背十分普遍并损害了知识迁移。本文中,我们为知识蒸馏的数据增强引入顺序约束,称为保序数据增强(IDA)。我们使用保序回归(IR)——一种经典的统计技术——来消除顺序违背。我们表明 IDA 可建模为树结构 IR 问题。据此我们适配经典的 IRT-BIN 算法以 O(clogc)O(c \log c) 时间复杂度求得最优解,其中 cc 为标签数。为进一步降低时间复杂度,我们还提出了具有线性时间复杂度的 GPU 友好近似。我们在不同数据集与数据增强技术上验证,所提 IDA 算法通过消除秩违背有效提升了知识蒸馏精度。

关键词

引用

@article{arxiv.2107.01412,
  title  = {Isotonic Data Augmentation for Knowledge Distillation},
  author = {Wanyun Cui and Sen Yan},
  journal= {arXiv preprint arXiv:2107.01412},
  year   = {2021}
}

备注

7 pages