PrUE:从稀疏教师网络蒸馏知识
计算机视觉与模式识别
2022-07-05 v1 人工智能
机器学习
摘要
尽管深度神经网络在各类任务中取得了显著成功,但其不断增长的规模也给部署带来了显著开销。为压缩这些模型,知识蒸馏被提出用于将知识从笨重(教师)网络迁移到轻量(学生)网络。然而,来自教师的指导并不总能改善学生的泛化能力,尤其是当学生与教师规模差距较大时。先前工作认为这是由于教师的高确定性,导致难以拟合的更硬标签。为软化这些标签,我们提出一种称为预测不确定性放大(PrUE)的剪枝方法以简化教师。具体而言,我们的方法旨在降低教师对数据的确定性,从而为学生生成软预测。我们在CIFAR-10/100、Tiny-ImageNet和ImageNet上通过实验实证研究了所提方法的有效性。结果表明,使用稀疏教师训练的学生网络取得了更好性能。此外,我们的方法允许研究者从更深的网络蒸馏知识以进一步提升学生。我们的代码已公开于:\url{https://github.com/wangshaopu/prue}。
引用
@article{arxiv.2207.00586,
title = {PrUE: Distilling Knowledge from Sparse Teacher Networks},
author = {Shaopu Wang and Xiaojun Chen and Mengzhen Kou and Jinqiao Shi},
journal= {arXiv preprint arXiv:2207.00586},
year = {2022}
}
备注
To appear in ECML PKDD 2022