中文

基于置信度的回答弃权: 通过基于激活的不确定性估计提升 LLM 可信度

计算与语言 2025-10-17 v2

摘要

我们提出了一种用于检索增强生成(RAG)系统的置信度估计方法,该方法与大型语言模型(LLM)输出的正确性紧密对齐。置信度估计在金融和医疗等高风险领域尤为关键,在这些领域,错误答案的成本高于不回答问题。我们的方法扩展了先前的不确定性量化方法,通过利用原始前馈网络(FFN)激活作为自回归信号,避免了在投影和 softmax 归一化后,令牌对数几率(logits)和概率中固有的信息损失。我们将置信度预测建模为一个序列分类任务,并使用 Huber 损失项对训练进行正则化,以提高对噪声监督的鲁棒性。在具有复杂知识库的真实世界金融行业客户支持场景中应用时,我们的方法优于强基线,并在严格的延迟约束下保持了高精度。在 Llama 3.1 8B 模型上的实验表明,仅使用第 16 层的激活即可在保持精度的同时降低响应延迟。我们的结果表明,基于激活的置信度建模为可信赖的 RAG 部署提供了一条可扩展的、架构感知的路径。

关键词

引用

@article{arxiv.2510.13750,
  title  = {Confidence-Based Response Abstinence: Improving LLM Trustworthiness via Activation-Based Uncertainty Estimation},
  author = {Zhiqi Huang and Vivek Datla and Chenyang Zhu and Alfy Samuel and Daben Liu and Anoop Kumar and Ritesh Soni},
  journal= {arXiv preprint arXiv:2510.13750},
  year   = {2025}
}

备注

UncertaiNLP at EMNLP 2025