向学生学习:应用t分布探索LLM的准确高效格式
机器学习
2024-06-12 v2 计算机视觉与模式识别
摘要
大型语言模型(LLM)规模的不断增长传统上需要低精度整数格式来满足严格的延迟和功耗需求。然而最近,诸如Normal Float (NF4)等替代格式以增加芯片面积为代价提高了模型精度。在这项工作中,我们首先对30个网络中的LLM权重和激活进行了大规模分析,并得出结论:大多数分布遵循学生t分布。然后我们推导出一种新的理论最优格式,Student Float (SF4),它在现代LLM上优于NF4,例如在LLaMA2-7B上平均准确率提高了0.76%。使用这种格式作为高精度参考,我们提出用两种超常支持变体增强E2M1以获得更高的模型精度。最后,我们通过评估11种数据类型的模型精度和硬件复杂度来探索质量和效率边界。我们发现由INT4、E2M1和具有超常支持的E2M1组成的帕累托曲线,在模型精度和芯片面积之间提供了连续的权衡。例如,具有超常支持的E2M1将Phi-2的准确率提高了高达2.19%,面积开销为1.22%,使得更多基于LLM的应用能够在四位上运行。支持代码托管在https://github.com/cornell-zhang/llm-datatypes。
引用
@article{arxiv.2405.03103,
title = {Learning from Students: Applying t-Distributions to Explore Accurate and Efficient Formats for LLMs},
author = {Jordan Dotzel and Yuzong Chen and Bahaa Kotb and Sushma Prasad and Gang Wu and Sheng Li and Mohamed S. Abdelfattah and Zhiru Zhang},
journal= {arXiv preprint arXiv:2405.03103},
year = {2024}
}
备注
Accepted to ICML 2024