中文

理解并缓解LLM推理中数值来源的非确定性

计算与语言 2025-10-28 v2

摘要

大型语言模型(LLM)现已渗透到各个领域,并展现出令人瞩目的性能。然而,进展建立在一个前提之上,即基准分数既准确又可复现。我们证明LLM性能的可复现性是脆弱的:更改系统配置,如评估批次大小、GPU数量和GPU版本,可能在生成的响应中引入显著差异。这个问题在推理模型中尤为明显,其中早期token的微小舍入差异可能级联为发散的思想链,最终影响准确性。例如,在使用bfloat16精度和贪婪解码时,像DeepSeek-R1-Distill-Qwen-7B这样的推理模型可能因GPU数量、类型和评估批次大小的不同而表现出高达9%的准确率变化和9,000个token的响应长度差异。我们将这种可变性的根源追溯到有限数值精度下浮点算术的非结合性。本工作首次系统性地研究了数值精度如何影响LLM推理中的可复现性。通过在各种硬件、软件和精度设置下进行精心控制的实验,我们量化了模型输出何时以及如何发生分歧。我们的分析揭示,尽管浮点精度对可复现性至关重要,但它在评估实践中常被忽视。受此启发,我们开发了一个轻量级推理流水线LayerCast,该流水线以16位精度存储权重但以FP32执行所有计算,在内存效率与数值稳定性之间取得平衡。代码可在https://github.com/nanomaoli/llm_reproducibility获取。

关键词

引用

@article{arxiv.2506.09501,
  title  = {Understanding and Mitigating Numerical Sources of Nondeterminism in LLM Inference},
  author = {Jiayi Yuan and Hao Li and Xinheng Ding and Wenya Xie and Yu-Jhe Li and Wentian Zhao and Kun Wan and Jing Shi and Xia Hu and Zirui Liu},
  journal= {arXiv preprint arXiv:2506.09501},
  year   = {2025}
}