中文

大型语言模型中的能量溢出

人工智能 2026-03-04 v4 计算与语言

摘要

我们将最终的大型语言模型 (LLM) softmax 分类器重新解释为能量基模型 (EBM),将序列到序列概率链分解为多个在推断过程中相互作用的 EBM。这种原则方法使我们能够在解码期间跟踪“能量溢出”,我们经验上显示,这与事实错误、偏见和失败相关。类似于 Orgad 等人 (2025),我们的方法在局部化确切答案标记后进行测试以检测幻觉。关键的是,我们无需训练探针分类器或执行激活剖析。相反,我们引入两个完全无训练的度量标准,直接从输出 logits 推导得出:能量溢出捕捉连续生成步骤之间能量值应理论上匹配的偏差,边际化能量则可在单一步骤中测量。在九个基准测试中评估了最先进的 LLM(包括 LLaMA、Mistral 和 Gemma),以及在合成代数运算中的 Qwen3,我们的方法在鲁棒性和跨任务泛化方面表现出竞争力。值得注意的是,这些结果对预训练和指令微调变体均适用,且不引入任何训练开销。代码地址: github.com/OmnAI-Lab/spilled-energy

关键词

引用

@article{arxiv.2602.18671,
  title  = {Spilled Energy in Large Language Models},
  author = {Adrian Robert Minut and Hazem Dewidar and Iacopo Masi},
  journal= {arXiv preprint arXiv:2602.18671},
  year   = {2026}
}