PalQuant:在低精度加速器上加速高精度网络
计算机视觉与模式识别
2022-08-04 v1
摘要
近来低精度深度学习加速器(DLAs)因其在芯片面积与能耗上的优势而流行,然而这些 DLAs 上的低精度量化模型带来了严重的精度下降。同时实现高精度与高效推理的一种方式是于低精度 DLAs 上部署高精度神经网络,这一点鲜有研究。本文中,我们提出并行低精度量化(PalQuant)方法,通过从头学习并行低精度表示来近似高精度计算。此外,我们提出一种新颖的循环洗牌模块,以增强并行低精度组间的跨组信息通信。大量实验表明,PalQuant 在精度与推理速度上均优于最先进的量化方法,例如,对于 ResNet-18 网络量化,PalQuant 在先进的 2-bit 加速器上相较其 4-bit 对应模型可同时获得高 0.52% 的精度与 1.78 的加速。代码见 \url{https://github.com/huqinghao/PalQuant}。
引用
@article{arxiv.2208.01944,
title = {PalQuant: Accelerating High-precision Networks on Low-precision Accelerators},
author = {Qinghao Hu and Gang Li and Qiman Wu and Jian Cheng},
journal= {arXiv preprint arXiv:2208.01944},
year = {2022}
}
备注
accepted by ECCV2022