中文

通道蒸馏:用于知识蒸馏的通道注意力

机器学习 2020-06-03 v1 机器学习

摘要

知识蒸馏是将教师网络从数据中学到的知识迁移到学生网络,使学生具有参数更少、计算量更小的优势,且精度接近教师。本文提出一种新的蒸馏方法,包含两种迁移蒸馏策略和一个损失衰减策略。第一种迁移策略基于通道注意力,称为通道蒸馏(CD)。CD 将通道信息从教师迁移到学生。第二种是引导式知识蒸馏(GKD)。与知识蒸馏(KD)让学生模仿教师对每个样本的预测分布不同,GKD 仅使学生模仿教师的正确输出。最后一部分是早期衰减教师(EDT)。在训练过程中,我们逐步衰减蒸馏损失的权重,目的是使学生逐渐掌控优化而非由教师掌控。我们提出的方法在 ImageNet 和 CIFAR100 上进行了评估。在 ImageNet 上,我们使用 ResNet18 取得了 27.68% 的 top-1 误差,优于现有最优方法。在 CIFAR100 上,我们取得了学生超越教师这一令人惊讶的结果。代码见 https://github.com/zhouzaida/channel-distillation。

关键词

引用

@article{arxiv.2006.01683,
  title  = {Channel Distillation: Channel-Wise Attention for Knowledge Distillation},
  author = {Zaida Zhou and Chaoran Zhuge and Xinwei Guan and Wen Liu},
  journal= {arXiv preprint arXiv:2006.01683},
  year   = {2020}
}