中文

利用超低比特量化与运行时在 Arm CPU 上加速深度学习模型推理

机器学习 2022-07-20 v1 人工智能

摘要

深度学习是近年来最具颠覆性的技术进展之一。深度学习模型的高性能以高计算、存储和功耗需求为代价。意识到加速和压缩这些模型以改善设备端性能的迫切需求,我们引入了 Deeplite Neutrino 用于生产就绪的模型优化,以及 Deeplite Runtime 用于在基于 Arm 的平台上部署超低比特量化模型。我们为 Armv7 和 Armv8 架构实现了底层量化核,从而支持在大量 32 位和 64 位基于 Arm 的设备上部署。通过利用向量化、并行化和分块的高效实现,我们在分类和检测模型上分别实现了相比带 XNNPACK 后端的 TensorFlow Lite 最高 2 倍和 2.2 倍的加速。相比 ONNX Runtime,我们在分类和检测模型上也分别实现了最高 5 倍和 3.2 倍的显著加速。

关键词

引用

@article{arxiv.2207.08820,
  title  = {Accelerating Deep Learning Model Inference on Arm CPUs with Ultra-Low Bit Quantization and Runtime},
  author = {Saad Ashfaq and MohammadHossein AskariHemmat and Sudhakar Sah and Ehsan Saboori and Olivier Mastropietro and Alexander Hoffman},
  journal= {arXiv preprint arXiv:2207.08820},
  year   = {2022}
}