面向数据高效知识蒸馏的自调节学习机制
机器学习
2021-04-26 v2 人工智能
计算机视觉与模式识别
摘要
现有的蒸馏方法不能高效地利用训练数据。本工作提出了一种仅使用训练数据子集来进行蒸馏的新方法,从而使其更具数据效率。为此,教师模型的训练被修改为包含自调节:训练集中的样本若被误分类或模型对其预测不够自信,则在反向传播中用于更新模型参数。与常规训练方法不同,这一修改限制了样本的参与。样本在自调节训练过程中参与的次数衡量了其对模型知识的重要性。这些重要性值被用于加权蒸馏过程中相应样本所产生的损失。该方法被命名为基于重要性的蒸馏(significance-based distillation)。为作比较,还提出了另外两种方法,其中学生模型通过蒸馏并像教师模型一样引入自调节来进行学习,分别利用或不利用教师训练期间计算的重要性信息。这两种方法分别被命名为混合蒸馏(hybrid distillation)和调节蒸馏(regulated distillation)。在基准数据集上的实验表明,所提方法在利用显著更少样本数量的同时,达到了与其他最先进(state-of-the-art)知识蒸馏方法相近的性能。
引用
@article{arxiv.2102.07125,
title = {Self Regulated Learning Mechanism for Data Efficient Knowledge Distillation},
author = {Sourav Mishra and Suresh Sundaram},
journal= {arXiv preprint arXiv:2102.07125},
year = {2021}
}
备注
8 pages, 5 figures, 6 tables, 27 references