中文

语言模型熵的校准问题研究

计算与语言 2026-01-14 v2 人工智能 机器学习 机器学习

摘要

我们研究了熵校准问题,即语言模型在生成文本时的熵是否匹配其对人类文本的对数损失。过往研究发现,模型存在校准不足的现象,即随着生成文本长度的增加,每个步骤的熵也在增大,这是由于错误累积导致的。为了校准模型并提升文本质量,目前的做法是截断分布,但这会降低输出多样性,我们希望避免这种情况。因此,本文提出:随着规模增加,校准不足是否会自动改善?若不行,是否存在无需权衡的校准方法?为建立直观理解,首先我们在简化的理论环境中研究了校准不足随数据集大小的比例行为。我们发现,比例尺的依赖性取决于数据分布的幂律指数——特别是当幂律指数接近1时,比例尺指数接近0,这意味着随规模增加,校准不足的改善速度非常缓慢。接着,我们对从0.5B到70B参数的语言模型进行了实证测量。我们发现观察到的比例尺行为与理论预测相似:我们的文本拟合比例尺指数接近0,这意味着更大的模型在与更小的模型相似的速率下累积误差。这种比例尺(或缺乏比例尺)为为何我们会以类似量级的截断采样更大的模型,尽管更大的模型质量更高,提供了一种解释。然而,截断并非令人满意的解决方案,因为它以增加对数损失为代价。理论上,是否可能在保持对数损失的同时降低熵?我们证明了如果假设我们能够访问一个黑盒子来预测文本未来熵的模型,就有可能实现这一点。

关键词

引用

@article{arxiv.2511.11966,
  title  = {On the Entropy Calibration of Language Models},
  author = {Steven Cao and Gregory Valiant and Percy Liang},
  journal= {arXiv preprint arXiv:2511.11966},
  year   = {2026}
}

备注

Neurips 2025