中文

基于注意力的深度神经网络量化

计算机视觉与模式识别 2021-03-25 v1 计算复杂性

摘要

网络权重与激活的低比特量化可大幅降低深度神经网络(DNNs)的内存占用、复杂度、能耗与延迟。然而,低比特量化也会导致明显的精度下降,尤其当应用于复杂学习任务或轻量级DNN架构时。本文提出一种放宽低比特量化的训练流程。我们称该流程为基于注意力的DNN量化(DNN Quantization with Attention, DQA)。该放宽通过可学习的高、中、低比特量化的线性组合实现。我们的学习流程利用带温度调度的注意力机制逐步收敛至低比特量化。在实验中,我们的方法在CIFAR10、CIFAR100与ImageNet ILSVRC 2012等多个目标识别基准上优于其他低比特量化技术,取得了与全精度DNN几乎相同的精度,并在量化轻量级DNN架构时显著减小了精度下降。

关键词

引用

@article{arxiv.2103.13322,
  title  = {DNN Quantization with Attention},
  author = {Ghouthi Boukli Hacene and Lukas Mauch and Stefan Uhlich and Fabien Cardinaux},
  journal= {arXiv preprint arXiv:2103.13322},
  year   = {2021}
}