中文

面向高效网络压缩的少样本知识蒸馏

机器学习 2020-04-01 v3 机器学习

摘要

剪枝和权重张量分解等深度神经网络压缩技术通常需要在压缩比较高时通过微调来恢复预测精度。然而,常规微调存在需要大规模训练集和训练过程耗时的弊端。本文提出一种从无标签少样本中蒸馏知识的新型方案,以实现数据效率与训练/处理效率的双重提升。我们将原始网络视为“教师网络”(teacher-net),将压缩网络视为“学生网络”(student-net)。在学生网络每个层块末端添加一个 1x1 卷积层,并通过估计所添加层的参数使学生网络在块级输出拟合教师网络。我们证明该添加层可在推理时合并,且不引入额外参数与计算开销。在多个数据集和网络架构上的实验验证了该方法对各类网络剪枝与权重分解所得学生网络的有效性。我们的方法仅使用完整训练数据 1% 的无标签数据,便能在数分钟内将学生网络精度恢复至与常规微调方法同等的水平。

关键词

引用

@article{arxiv.1812.01839,
  title  = {Few Sample Knowledge Distillation for Efficient Network Compression},
  author = {Tianhong Li and Jianguo Li and Zhuang Liu and Changshui Zhang},
  journal= {arXiv preprint arXiv:1812.01839},
  year   = {2020}
}

备注

CVPR 2020