通过不确定性校准微调提升大语言模型的可信度
计算与语言
2026-04-21 v2 人工智能
机器学习
摘要
大型语言模型 (LLM) 凭借其出色的推理和问答能力在自然语言处理领域取得了显著进展。然而,这些模型有时会生成听起来可信却不正确的信息,称为 LLM 幻觉。可靠的不确定性估计对于培育 LLM 生成响应的信任至关重要,同时也是检测和预防错误或幻觉输出的关键工具。为实现开放式和自由形式自然语言生成中可靠且良好校准的不确定性量化,我们提出了一种面向 LLM 的不确定性感知微调方法。该方法在不牺牲准确性的前提下,增强了模型提供可靠不确定性估计的能力,从而引导其生成更可信的响应。我们引入了一种基于决策理论原则的新型不确定性感知因果语言建模损失函数。通过在多个自由形式问答数据集和模型上的严格评估,我们证明了不确定性感知微调方法在自然语言生成任务中比使用标准因果语言建模损失进行的微调更能准确校准不确定性估计。此外,实验结果表明,所提方法显著提高了模型检测幻觉和识别域外提示的能力。
引用
@article{arxiv.2412.02904,
title = {Enhancing Trust in Large Language Models via Uncertainty-Calibrated Fine-Tuning},
author = {Ranganath Krishnan and Piyush Khanna and Omesh Tickoo},
journal= {arXiv preprint arXiv:2412.02904},
year = {2026}
}
备注
ICLR 2026 Trustworthy AI workshop