用于深度学习的FP8格式
机器学习
2022-10-03 v2
摘要
FP8是在现代处理器中常见的16位格式之外加速深度学习训练推理的自然演进。在本文中,我们提出一种8位浮点(FP8)二进制交换格式,由两种编码组成——E4M3(4位指数和3位尾数)和E5M2(5位指数和2位尾数)。虽然E5M2遵循IEEE 754关于特殊值表示的约定,但E4M3通过不表示无穷大且仅有单一的NaN尾数位模式来扩展其动态范围。我们在各种图像和语言任务上展示了FP8格式的有效性,有效匹配了16位训练会话所达到的结果质量。我们的研究涵盖了主要的现代神经网络架构——CNN、RNN和基于Transformer的模型,所有超参数均保持与16位基线训练会话不变。我们的训练实验包括高达175B参数的大型语言模型。我们还考察了使用16位格式训练且抵抗定点int8量化的语言模型的FP8训练后量化。
引用
@article{arxiv.2209.05433,
title = {FP8 Formats for Deep Learning},
author = {Paulius Micikevicius and Dusan Stosic and Neil Burgess and Marius Cornea and Pradeep Dubey and Richard Grisenthwaite and Sangwon Ha and Alexander Heinecke and Patrick Judd and John Kamalu and Naveen Mellempudi and Stuart Oberman and Mohammad Shoeybi and Michael Siu and Hao Wu},
journal= {arXiv preprint arXiv:2209.05433},
year = {2022}
}