中文

Nanascailing 浮点 (NxFP):NanoMantissa、自适应微指数与代码循环用于大语言模型直接转换压缩

硬件体系结构 2024-12-31 v1 人工智能 分布式、并行与集群计算 机器学习

摘要

随着前沿大语言模型 (LLMs) 不断变革多个行业,其快速增长的模型规模和序列长度导致了内存流量与容量的挑战。最近,AMD、Arm、Intel、Meta、Microsoft、NVIDIA 和 Qualcomm 提出了 Microscaling 标准 (Mx),通过引入微指数来增强块浮点格式,以实现有前景的 perplexity 与存储量之间的权衡。然而,Microscaling 在对现代 LLMs(模型位数不足六位)时会出现显著的 perplexity 降级。本文剖析了现代 LLMs,识别出低位数 Microscaling 格式的三个主要挑战:精准跟踪异常值的不准确、量化层级的空闲以及浪费的二进制代码。在此基础上,Nanascailing (NxFP) 提出三项技术,即 NanoMantissa、自适应微指数和代码循环,以实现对比最先进 MxFP 更高的准确率和更小的内存占用。实验结果表明,在各种现代 LLMs 上进行的直接转换推理中,我们的方法在 perplexity 上优于最先进 MxFP 最高可达 0.64,在 MMLU 测试基准上的准确率提升最高可达 30%。此外,NxFP 在保持相当于 MxFP 水平的 perplexity 的同时,将内存占用降低最高可达 16%。

关键词

引用

@article{arxiv.2412.19821,
  title  = {Nanoscaling Floating-Point (NxFP): NanoMantissa, Adaptive Microexponents, and Code Recycling for Direct-Cast Compression of Large Language Models},
  author = {Yun-Chen Lo and Gu-Yeon Wei and David Brooks},
  journal= {arXiv preprint arXiv:2412.19821},
  year   = {2024}
}

备注

12 pages, 12 figures