基于不确定性感知混合的数据高效知识蒸馏
计算机视觉与模式识别
2020-12-18 v1
摘要
知识蒸馏通过从教师网络提取“暗知识”以引导学生网络学习,已成为模型压缩与迁移学习的关键技术。不同于以往关注学生网络精度的工作,本文研究一个鲜被探索却重要的问题,即知识蒸馏效率。我们的目标是以更低的训练计算成本取得与传统知识蒸馏相当的性能。我们表明不确定性感知混合(UNIX)可作为一种简洁而有效的方案。不确定性采样策略用于评估各训练样本的信息量。对不确定样本施加自适应 mixup 以压缩知识。我们进一步表明,传统知识蒸馏的冗余在于对简单样本的过度学习。通过结合不确定性与 mixup,我们的方法降低了冗余,并更好地利用对教师网络的每次查询。我们在 CIFAR100 与 ImageNet 上验证方法。值得注意的是,仅以 79% 的计算成本,我们在 CIFAR100 上优于传统知识蒸馏,并在 ImageNet 上取得相当结果。
引用
@article{arxiv.2012.09413,
title = {Computation-Efficient Knowledge Distillation via Uncertainty-Aware Mixup},
author = {Guodong Xu and Ziwei Liu and Chen Change Loy},
journal= {arXiv preprint arXiv:2012.09413},
year = {2020}
}
备注
The code is available at: https://github.com/xuguodong03/UNIXKD