中文

基于 FP8 格式的高效训练后量化

机器学习 2024-04-02 v2 人工智能 计算与语言

摘要

LLM 和扩散模型等深度学习方法的最新进展,产生了对改进量化方法的需求,这些方法需满足这些现代架构的计算需求同时保持精度。为此,我们研究了 FP8 数据格式在覆盖广泛任务的 75 种独特网络架构上的训练后量化优势,包括机器翻译、语言建模、文本生成、图像分类、生成与分割。我们考察了三种不同的 FP8 表示(E5M2、E4M3 和 E3M4),以研究动态范围与精度之间不同程度权衡对模型精度的影响。基于我们的广泛研究,我们开发了一种可泛化至不同网络架构的量化工作流。我们的实证结果表明,FP8 格式在多个方面优于 INT8,包括工作负载覆盖率(92.64% 对比 65.87%)、模型精度以及对更广泛操作的适用性。此外,我们的发现表明 E4M3 更适用于 NLP 模型,而 E3M4 在计算机视觉任务上比 E4M3 略优。代码已在 Intel Neural Compressor 上公开:https://github.com/intel/neural-compressor。

关键词

引用

@article{arxiv.2309.14592,
  title  = {Efficient Post-training Quantization with FP8 Formats},
  author = {Haihao Shen and Naveen Mellempudi and Xin He and Qun Gao and Chang Wang and Mengni Wang},
  journal= {arXiv preprint arXiv:2309.14592},
  year   = {2024}
}