中文

基于核的渐进蒸馏用于加法神经网络

计算机视觉与模式识别 2020-10-16 v3 机器学习

摘要

仅包含加法的加法神经网络(ANNs)为我们提供了一种以低能耗开发深度神经网络的新途径。遗憾的是,当用加法滤波器替换所有卷积滤波器时会出现精度下降。其主要原因是使用 1\ell_1-范数的 ANNs 优化困难,其中反向传播中梯度的估计不准确。在本文中,我们提出了一种新方法,通过基于核的渐进知识蒸馏(PKKD)方法在不增加可训练参数的情况下进一步提升 ANNs 的性能。具有相同架构的卷积神经网络(CNN)被同时初始化并训练为教师网络,ANN 和 CNN 的特征与权重将被转换到新空间以消除精度下降。相似性在高维空间中通过基于核的方法进行以解耦其分布差异。最终,所需的 ANN 基于来自真实标签和教师的信息渐进地学习得到。所提方法对学习更高性能 ANN 的有效性在多个基准上得到了充分验证。例如,使用所提 PKKD 方法训练的 ANN-50 在 ImageNet 数据集上获得了 76.8% 的 top-1 精度,比 ResNet-50 高 0.6%。

关键词

引用

@article{arxiv.2009.13044,
  title  = {Kernel Based Progressive Distillation for Adder Neural Networks},
  author = {Yixing Xu and Chang Xu and Xinghao Chen and Wei Zhang and Chunjing Xu and Yunhe Wang},
  journal= {arXiv preprint arXiv:2009.13044},
  year   = {2020}
}

备注

Accepted by NeurIPS 2020, spotlight