中文

LAMP:大型语言模型的前视混合精度推理

机器学习 2026-05-08 v2 数值分析 数值分析

摘要

混合精度计算是当前人工智能阶段的标志性特征,推动大型语言模型向高效、本地部署解决方案的进展。本文聚焦于具有组成性函数的浮点计算,具体关注 transformer 的推理。基于函数组成 f(g(x))f(g(\mathrm{x})) 的四舍五入误差分析,我们提供一种自适应策略,选取 g(x)g(\mathrm{x}) 的一小部分组成部分以更高精度计算,而所有其他计算可采用较低精度。我们随后解释了该策略如何应用于 transformer 中的不同组成部分,并展示其对 transformer 推理的整体效果。我们在 GPT-2 模型上对该算法有效性进行数值研究,证明即便存在非常低的重计算率,仍可实现高达两个数量级的精度提升。

关键词

引用

@article{arxiv.2601.21623,
  title  = {LAMP: Look-Ahead Mixed-Precision Inference of Large Language Models},
  author = {Stanislav Budzinskiy and Marian Gloser and Tolunay Yilmaz and Ying Hong Tham and Yuanyi Lin and Wenyi Fang and Fan Wu and Philipp Petersen},
  journal= {arXiv preprint arXiv:2601.21623},
  year   = {2026}
}

备注

Major revision