中文

基于齐夫标签平滑的高效一遍式自蒸馏

计算机视觉与模式识别 2022-07-27 v1

摘要

自蒸馏在训练过程中利用来自自身的非均匀软监督,在不带来任何推理开销的情况下提升性能。然而,训练期间的开销常被忽视,而在大模型时代,降低训练的时间和内存开销愈发重要。本文提出一种名为齐夫标签平滑(Zipf's LS)的高效自蒸馏方法,该方法利用网络即时预测生成符合齐夫分布的软监督,无需使用任何对比样本或辅助参数。我们的想法源于一项经验观察:当网络得到恰当训练后,网络最终 softmax 层的输出值按大小排序并在样本间取平均后,应遵循类似于自然语言词频统计中齐夫定律的分布。通过在样本层面并贯穿整个训练周期强制这一性质,我们发现预测准确率可大幅提升。在 INAT21 细粒度分类数据集上使用 ResNet50,我们的技术相较原始基线实现 +3.61% 的准确率提升,并比先前的标签平滑或自蒸馏策略多带来 0.88% 的提升。实现已公开于 https://github.com/megvii-research/zipfls。

关键词

引用

@article{arxiv.2207.12980,
  title  = {Efficient One Pass Self-distillation with Zipf's Label Smoothing},
  author = {Jiajun Liang and Linze Li and Zhaodong Bing and Borui Zhao and Yao Tang and Bo Lin and Haoqiang Fan},
  journal= {arXiv preprint arXiv:2207.12980},
  year   = {2022}
}

备注

Accepted by ECCV2022