中文

来自上一小批次的自蒸馏用于一致性正则化

计算机视觉与模式识别 2023-03-06 v1

摘要

知识蒸馏(KD)作为一种强大的正则化策略展现出光明前景,可通过利用学到的样本级软目标来提升泛化能力。然而,现有KD中采用复杂的预训练教师网络或学生同伴集成既耗时又计算昂贵。已有多种自蒸馏方法被提出以实现更高的蒸馏效率。但它们要么需要额外的网络架构修改,要么难以并行化。为应对这些挑战,我们提出一种高效可靠的自蒸馏框架,称为来自上一小批次的自蒸馏(DLB)。具体而言,我们通过约束每个小批次的一半与上次迭代重合来重排顺序采样。同时,另一半将与下次迭代重合。之后,前半小批次对上次迭代中生成的即时软目标进行蒸馏。我们提出的机制引导训练稳定性与一致性,从而对标签噪声具有鲁棒性。此外,我们的方法易于实现,不占用额外运行内存或要求模型结构修改。在三个分类基准上的实验结果表明,我们的方法能持续以不同网络架构优于最先进的自蒸馏方法。另外,我们的方法通过与增强策略的强兼容性获得额外性能提升。代码可在 https://github.com/Meta-knowledge-Lab/DLB 获取。

关键词

引用

@article{arxiv.2203.16172,
  title  = {Self-Distillation from the Last Mini-Batch for Consistency Regularization},
  author = {Yiqing Shen and Liwu Xu and Yuzhe Yang and Yaqian Li and Yandong Guo},
  journal= {arXiv preprint arXiv:2203.16172},
  year   = {2023}
}

备注

10 pages