中文

层间真相:基于层内局部信息得分的大语言模型不确定性估计

机器学习 2026-03-25 v1 人工智能

摘要

大语言模型 (LLM) 常常自信地出错,对可靠的不确定性估计 (Uncertainty Estimation, UE) 至关重要。基于输出的启发式方法计算成本低但脆弱,而探测内部表示则有效但维度高且难以迁移。我们提出一种紧凑的、针对单个实例的 UE 方法,通过单次前向传播对内部表示中跨层一致性模式进行评分。我们的方法在三个模型上均与探测方法相当,In-Distribution 情况下,平均对角差异最多为 -1.8 个 AUPRC 比例点,Brier 分数提升 4.9 分。跨数据集迁移方面,我们的方法始终优于探测,实现了最高可达 +2.86 个 AUPRC 和 +21.02 个 Brier 分数的离线收益。在 4 位量化-only 条件下,方法仍保持稳健,平均改善探测的 +1.94 个 AUPRC 和 +5.33 个 Brier 分数。除了性能外,我们通过具体的层-层交互分析揭示了不同模型如何编码不确定性的差异。总体而言,我们的 UE 方法提供了一种轻量、紧凑的手段,能够捕捉可迁移的 LLM 不确定性。

关键词

引用

@article{arxiv.2603.22299,
  title  = {Between the Layers Lies the Truth: Uncertainty Estimation in LLMs Using Intra-Layer Local Information Scores},
  author = {Zvi N. Badash and Yonatan Belinkov and Moti Freiman},
  journal= {arXiv preprint arXiv:2603.22299},
  year   = {2026}
}