面向大语言模型中可靠的事实对齐不确定性估计
人工智能
2026-04-02 v1 计算与语言
摘要
不确定性估计(UE)旨在检测大语言模型(LLM)的幻觉输出,以提升其可靠性。然而,UE 指标在不同配置下表现出不稳定的性能,这严重限制了其适用性。本工作将这一现象形式化为代理失效,因为大多数 UE 指标源于模型行为,而非明确基于 LLM 输出的事实正确性。由此,我们证明 UE 指标在低信息条件下恰好失去判别力。为缓解这一问题,我们提出 Truth AnChoring(TAC),一种后验校准方法,通过将原始分数映射到事实对齐分数来修正 UE 指标。即使在噪声大且少样本监督的条件下,我们的 TAC 也能支持学习良好校准的不确定性估计,并提供了一种实用的校准协议。我们的发现揭示了将启发式 UE 指标直接视为事实不确定性的指标的局限性,并将 TAC 定位为迈向更可靠 LLM 不确定性估计的必要步骤。代码仓库位于 https://github.com/ponhvoan/TruthAnchor/。
引用
@article{arxiv.2604.00445,
title = {Towards Reliable Truth-Aligned Uncertainty Estimation in Large Language Models},
author = {Ponhvoan Srey and Quang Minh Nguyen and Xiaobao Wu and Anh Tuan Luu},
journal= {arXiv preprint arXiv:2604.00445},
year = {2026}
}