中文

基于 Dropout 的自知识蒸馏

计算机视觉与模式识别 2022-08-12 v1

摘要

为了提升性能,深度神经网络需要更深或更宽的网络结构,这带来了巨大的计算和内存开销。为缓解该问题,自知识蒸馏方法通过蒸馏模型自身的内部知识来正则化模型。传统的自知识蒸馏方法需要额外的可训练参数或依赖于数据。本文提出一种简单有效的使用 dropout 的自知识蒸馏方法(SD-Dropout)。SD-Dropout 通过 dropout 采样来蒸馏多个模型的后验分布。我们的方法不需要任何额外的可训练模块,不依赖数据,且仅需简单操作。此外,这一简单方法可轻松与多种自知识蒸馏方法结合。我们对前向和反向 KL 散度在本文工作中的影响进行了理论与实验分析。在图像分类、目标检测和分布偏移等多种视觉任务上的大量实验表明,所提方法能有效提升单一网络的泛化能力。进一步实验表明,该方法还能改善校准性能、对抗鲁棒性和分布外检测能力。

关键词

引用

@article{arxiv.2208.05642,
  title  = {Self-Knowledge Distillation via Dropout},
  author = {Hyoje Lee and Yeachan Park and Hyun Seo and Myungjoo Kang},
  journal= {arXiv preprint arXiv:2208.05642},
  year   = {2022}
}

备注

11 pages