中文

基于顺序内部离散性的大语言模型不确定性学习

计算与语言 2026-04-20 v1 人工智能

摘要

不确定性估计是检测大语言模型(LLM)幻觉的有前景的方法。最近的一些方法依赖模型内部状态来估计不确定性,但它们受限于对隐藏状态如何在图层之间演化的严格假设,以及仅关注最后一个或平均标记所导致的信息损失。为此,我们提出Sequential Internal Variance Representation(SIVR),一种监督式幻觉检测框架,利用从隐藏状态中派生的按标记、按图层特征。SIVR假设不确定性表现为内部表示在图层之间离散程度或方差,而非依赖于特定假设,这使该方法对模型和任务均不依赖。它此外聚合每个标记的方差特征的完整序列,学习引发事实错误的时序模式,从而防止信息损失。实验结果表明,SIVR consistently优于强大的基线方法。最重要的是,SIVR拥有更强的泛化能力,且无需依赖大量训练数据,凸显了其实际部署的潜力。我们的代码仓库已在线公开,地址为https://github.com/ponhvoan/internal-variance。

关键词

引用

@article{arxiv.2604.15741,
  title  = {Learning Uncertainty from Sequential Internal Dispersion in Large Language Models},
  author = {Ponhvoan Srey and Xiaobao Wu and Cong-Duy Nguyen and Anh Tuan Luu},
  journal= {arXiv preprint arXiv:2604.15741},
  year   = {2026}
}

备注

Accepted at ACL 2026 (Main Conference)