面向知识蒸馏的保序数据增强
机器学习
2021-07-07 v2 人工智能
摘要
知识蒸馏同时使用真实硬标签与教师模型预测的软标签作为监督。直观上,我们期望软标签与硬标签就其概率顺序而言是一致的。然而,我们发现增强样本中硬标签与软标签之间存在严重的顺序违背。例如,对于增强样本 ,我们期望有意义软标签的顺序为 。但真实软标签通常违背该顺序,如 。我们将此归因于教师泛化能力不佳导致增强样本的预测错误。实证上,我们发现此类违背十分普遍并损害了知识迁移。本文中,我们为知识蒸馏的数据增强引入顺序约束,称为保序数据增强(IDA)。我们使用保序回归(IR)——一种经典的统计技术——来消除顺序违背。我们表明 IDA 可建模为树结构 IR 问题。据此我们适配经典的 IRT-BIN 算法以 时间复杂度求得最优解,其中 为标签数。为进一步降低时间复杂度,我们还提出了具有线性时间复杂度的 GPU 友好近似。我们在不同数据集与数据增强技术上验证,所提 IDA 算法通过消除秩违背有效提升了知识蒸馏精度。
引用
@article{arxiv.2107.01412,
title = {Isotonic Data Augmentation for Knowledge Distillation},
author = {Wanyun Cui and Sen Yan},
journal= {arXiv preprint arXiv:2107.01412},
year = {2021}
}
备注
7 pages