中文

面向混合精度神经网络的片上硬件感知量化

机器学习 2024-05-24 v5 人工智能 硬件体系结构

摘要

低比特量化成为在边缘设备上部署深度神经网络最有前景的压缩方法之一。混合精度量化利用多种位宽组合来释放量化模型的精度与效率潜力。然而,现有混合精度量化方法依赖高性能设备上的仿真,以在巨大搜索空间中实现精度与效率权衡。这导致估计的效率指标与实际硬件之间存在不可忽略的差距,使量化模型远离最优精度与效率,并且使量化过程依赖额外的高性能设备。本文提出片上硬件感知量化(OHQ)框架,在已部署的边缘设备上执行硬件感知的混合精度量化,以实现准确高效的计算。具体地,对于效率指标,我们构建了片上量化感知流水线,使量化过程能感知量化算子的实际硬件效率,避免不准确仿真导致的优化错误。对于精度指标,我们提出掩码引导量化估计技术,以有效估计片上场景下算子的精度影响,摆脱量化过程对高算力的依赖。通过线性优化综合量化模型与硬件的洞察,我们可获得优化的位宽配置,在精度与效率上取得优异性能。我们在硬件上针对多种架构和压缩比评估了量化推理精度与加速效果。OHQ在ResNet-18和MobileNetV3上分别达到70%和73%的精度,且相比INT8在实际部署中可降低15~30%延迟。

关键词

引用

@article{arxiv.2309.01945,
  title  = {On-Chip Hardware-Aware Quantization for Mixed Precision Neural Networks},
  author = {Wei Huang and Haotong Qin and Yangdong Liu and Jingzhuo Liang and Yulun Zhang and Ying Li and Xianglong Liu},
  journal= {arXiv preprint arXiv:2309.01945},
  year   = {2024}
}

备注

10 pages, 6 figures