中文

QKD:量化感知知识蒸馏

计算机视觉与模式识别 2019-12-02 v1 机器学习

摘要

量化和知识蒸馏(KD)方法被广泛用于降低深度神经网络(DNNs)的内存与功耗,特别是对于资源受限的边缘设备。尽管二者结合颇有望满足这些需求,但可能不如预期般有效。这主要是因为KD的正则化效应进一步削弱了量化模型本已降低的表征能力。为解决此缺陷,我们提出量化感知知识蒸馏(QKD),其中量化与KD在三个阶段中精心协调。首先,自学(SS)阶段在无KD情况下微调量化低精度学生网络以获得良好初始化。其次,共学(CS)阶段尝试训练一个教师网络,使其比固定教师更量化友好且更强。最后,辅导(TU)阶段将知识从训练好的教师迁移至学生。我们在ImageNet与CIFAR-10/100数据集上广泛评估了我们的方法,并对具有标准卷积与深度可分离卷积的网络进行了消融研究。所提出的QKD优于现有state-of-the-art方法(例如,在W4A4的ResNet-18上提升1.3%,在W4A4的MobileNetV2上提升2.6%)。此外,QKD能在低至W3A3量化的ResNet与W6A6量化的MobilenetV2上恢复全精度准确率。

关键词

引用

@article{arxiv.1911.12491,
  title  = {QKD: Quantization-aware Knowledge Distillation},
  author = {Jangho Kim and Yash Bhalgat and Jinwon Lee and Chirag Patel and Nojun Kwak},
  journal= {arXiv preprint arXiv:1911.12491},
  year   = {2019}
}