DeepGEMM:基于查找表在CPU架构上加速超低精度推理
机器学习
2023-04-19 v1
摘要
近期超低比特量化取得了大量进展,有望在边缘设备上显著改善延迟、内存占用与能耗。诸如 Learned Step Size Quantization 等量化方法即使采用亚字节量化也能达到与全精度浮点基线相当的模型精度。然而,在主流 CPU 设备上部署这些超低比特量化模型极为困难,因为商用 SIMD(单指令多数据)硬件通常支持不低于 8 位精度。为克服该限制,我们提出 DeepGEMM,一种基于查找表的方法,用于在 SIMD 硬件上执行超低精度卷积神经网络。所提方法预计算权重与激活的所有可能乘积,将其存入查找表,并在推理时高效访问以避免昂贵的乘累加操作。我们的 2 位实现在 x86 平台上相较 QNNPACK 框架中相应的 8 位整数核最高加速 1.74 倍。
引用
@article{arxiv.2304.09049,
title = {DeepGEMM: Accelerated Ultra Low-Precision Inference on CPU Architectures using Lookup Tables},
author = {Darshan C. Ganji and Saad Ashfaq and Ehsan Saboori and Sudhakar Sah and Saptarshi Mitra and MohammadHossein AskariHemmat and Alexander Hoffman and Ahmed Hassanien and Mathieu Léonardon},
journal= {arXiv preprint arXiv:2304.09049},
year = {2023}
}