中文

Benford 的诅咒: 追踪 LLM 中从数字偏见到数值幻觉的轨迹

计算与语言 2025-12-01 v2

摘要

大型语言模型(LLMs)在复杂推理任务上表现出令人印象深刻的性能,但它们在基本数值问题上经常失败,产生错误的输出。受Benford定律(一种较低数字作为首位数字出现频率更高的统计模式)的启发,我们假设网络收集语料库中倾斜的数字分布可能在预训练期间被LLMs学习,从而导致有偏见的数值生成。为了调查这一假设,我们首先检查预训练语料库(OLMo2)中的数字频率是否遵循Benford定律。然后,我们构建了一个评估基准,其中真实数字在七项数值推理任务中的每一项内均匀分布。我们的评估结果表明,领先的开源LLMs表现出类似于Benford定律的数字偏见一致模式。通过logit透镜追踪和神经元层面的解剖,我们发现这种偏见主要源于深层中一小部分高度数字选择性的前馈网络(FFN)神经元。最后,我们证明剪枝这些神经元可以缓解不平衡的过度生成并部分纠正错误输出,提供了细粒度预训练数字偏见可传播至模型行为的因果证据。我们的发现揭示了LLMs中语料库级统计与符号失效模式之间的基本联系,为诊断和缓解数值任务中的幻觉提供了新视角。

关键词

引用

@article{arxiv.2506.01734,
  title  = {Benford's Curse: Tracing Digit Bias to Numerical Hallucination in LLMs},
  author = {Jiandong Shao and Yao Lu and Jianfei Yang},
  journal= {arXiv preprint arXiv:2506.01734},
  year   = {2025}
}

备注

NeurIPS 2025