中文

基于知识蒸馏的在线集成模型压缩

计算机视觉与模式识别 2020-11-17 v1

摘要

本文提出一种新颖的基于知识蒸馏的模型压缩框架,其由学生集成构成。它可将同时学习的集成知识蒸馏至每个压缩学生模型上。每个模型因其独特架构而从数据分布中学习独特表示。这有助于集成通过结合各模型知识获得更好泛化。蒸馏学生与集成教师同时训练,无需任何预训练权重。此外,我们提出的方法可通过单次训练交付多压缩学生,高效且灵活适配不同场景。我们提供使用SOTA分类模型的综合实验以验证框架有效性。值得注意的是,使用我们的框架,一个97%压缩的ResNet110学生模型在CIFAR100数据集上相较其独立基线训练取得了10.64%的相对准确率提升。类似地,一个95%压缩的DenseNet-BC(k=12)模型取得了8.17%的相对准确率提升。

关键词

引用

@article{arxiv.2011.07449,
  title  = {Online Ensemble Model Compression using Knowledge Distillation},
  author = {Devesh Walawalkar and Zhiqiang Shen and Marios Savvides},
  journal= {arXiv preprint arXiv:2011.07449},
  year   = {2020}
}