中文

超越可重复性:Token 概率揭示大型语言模型的非决定性

人工智能 2026-05-19 v5 计算与语言 计算机与社会

摘要

大型语言模型(LLM)的执行已被证明即使在配置为产生确定性结果时,也会在图形处理器(GPU)上产生非决定性结果。这是由于算术运算的有限精度效应,取决于它们执行的顺序。这种顺序反过来取决于 GPU 上并发运行的进程。以往的研究聚焦于非决定性对 LLM 生成文本的影响,或提出实现确定性执行的机制。本工作更深入地分析了非决定性,通过分析 token 概率的变化,而非生成的文本。有趣的是,所有评估的模型在趋势和实际概率变化值方面都有相似的结果。特别是,结果显示,非决定性的影响在概率范围为 0.1 到 0.9 的 token 概率上较为显著,而在概率接近 0 或 1 时则要小得多。这对我们理解非决定性具有重大意义。首先,非决定性很可能在温度不为零时对生成的文本产生显著影响,因为它在除概率接近 0 或 1 时引入了显著的 token 概率变化。其次,它表明所有模型在 token 概率层面都有相似的非决定性变化。因此,不同的生成文本性能变化(例如,在衡量基准准确性时),似乎源于不同的 token 概率或响应长度。第三, 我们可能通过进行单次推理并分析 token 级别的概率来估计非决定性的影响,而不必进行多次相同的推理。

关键词

引用

@article{arxiv.2601.06116,
  title  = {The Homogenization Problem in LLMs: Towards Meaningful Diversity in AI Safety},
  author = {Ian Rios-Sialer},
  journal= {arXiv preprint arXiv:2601.06116},
  year   = {2026}
}