ZeroQuant-HERO:面向 W8A8 Transformer 的硬件增强鲁棒优化训练后量化框架
机器学习
2023-10-30 v1 计算与语言
摘要
量化技术对于降低深度神经网络推理的内存与计算需求至关重要。现有方案(如 ZeroQuant)为 BERT 与 GPT 等模型提供动态量化,但忽略了关键的内存受限算子以及逐 token 量化的复杂性。为解决这些不足,我们提出一种新颖的、完全硬件增强的鲁棒优化训练后 W8A8 量化框架 ZeroQuant-HERO。该框架独特地集成了内存带宽密集与计算密集两类算子,旨在实现最优硬件性能。此外,它通过允许特定 INT8 模块切换至 FP16/BF16 模式来提供灵活性,从而提升精度。
引用
@article{arxiv.2310.17723,
title = {ZeroQuant-HERO: Hardware-Enhanced Robust Optimized Post-Training Quantization Framework for W8A8 Transformers},
author = {Zhewei Yao and Reza Yazdani Aminabadi and Stephen Youn and Xiaoxia Wu and Elton Zheng and Yuxiong He},
journal= {arXiv preprint arXiv:2310.17723},
year = {2023}
}
备注
8 pages, 2 figures