FP8 与 INT8 在高效深度学习推理中的对比
机器学习
2023-06-16 v2
摘要
近来,将 FP8 用作神经网络训练数值格式的想法在深度学习领域流传开来。鉴于当前大多数训练以整个网络采用 FP32 进行,或有时采用 FP16 混合精度,让网络部分以 8 位权重的 FP8 运行,对于深度学习通常代价高昂且耗时的训练过程而言,是一个颇具吸引力的潜在加速方案。一个自然的问题是:这一进展对于边缘设备上的高效推理意味着什么。在高效推理设备领域,工作负载常以 INT8 执行,在效率需要时甚至有时低至 INT4。在本技术白皮书中,我们比较了 FP8 与 INT 格式在高效设备端推理上的性能。我们从理论上展示了神经网络中 INT 与 FP 格式的差异,并给出大量训练后量化与量化感知训练结果,以说明该理论如何转化为实践。我们还提供了硬件分析,表明在专用硬件中 FP 格式的计算效率比 INT 格式低约 50% 至 180%。基于我们的研究及对研究领域的梳理,我们得出结论:尽管所提出的 FP8 格式可能利于训练,但其在推理上的结果并不足以支持为高效推理而专门实现 FP8 以取代 INT8。我们表明,我们的结果大体与先前发现一致,但格式间的重要比较迄今仍属缺失。最后,我们讨论了 FP8 训练的网络转换为 INT8 时的情况,并以简要探讨设备端部署的最高效方式以及针对众多模型的广泛 INT8 结果作为收尾。
引用
@article{arxiv.2303.17951,
title = {FP8 versus INT8 for efficient deep learning inference},
author = {Mart van Baalen and Andrey Kuzmin and Suparna S Nair and Yuwei Ren and Eric Mahurin and Chirag Patel and Sundar Subramanian and Sanghyuk Lee and Markus Nagel and Joseph Soriaga and Tijmen Blankevoort},
journal= {arXiv preprint arXiv:2303.17951},
year = {2023}
}