自动化后端感知训练后量化
计算机视觉与模式识别
2021-03-30 v1
摘要
量化是降低神经网络部署资源需求并提升性能的关键技术。然而,不同硬件后端如x86 CPU、NVIDIA GPU、ARM CPU及加速器可能要求量化网络的不同实现。这种多样性需要为每个硬件目标构建专门的训练后量化流水线,这是开发者往往难以跟上的巨大工程投入。我们以名为HAGO的自动化训练后量化框架解决此问题。HAGO基于用户定义的硬件规范提供一组通用量化图变换,并实现搜索机制以在任何模型满足硬件约束下找到最优量化策略。我们观察到,HAGO在Intel Xeon Cascade Lake CPU、NVIDIA Tesla T4 GPU、树莓派4上的ARM Cortex-A CPU上分别相对于全精度实现了2.09倍、1.97倍和2.48倍的加速,同时在各情况下保持所报告的最高训练后量化精度。
引用
@article{arxiv.2103.14949,
title = {Automated Backend-Aware Post-Training Quantization},
author = {Ziheng Jiang and Animesh Jain and Andrew Liu and Josh Fromm and Chengqian Ma and Tianqi Chen and Luis Ceze},
journal= {arXiv preprint arXiv:2103.14949},
year = {2021}
}