中文

使用近似贝叶斯计算对大语言模型进行不确定性量化

机器学习 2025-09-25 v1 人工智能 机器学习

摘要

尽管大语言模型(LLM)应用广泛,但它们通常难以表达不确定性,这对其在临床诊断等高风险和安全关键领域的可靠部署构成了挑战。现有的标准基线方法,如模型 logits 和启发式概率,会产生过度自信且校准不佳的估计。在这项工作中,我们提出了一种基于近似贝叶斯计算(Approximate Bayesian Computation, ABC)的方法,这是一种免似然的贝叶斯推理方法,它将 LLM 视为一个随机模拟器,以推断预测概率的后验分布。我们在两个临床相关的基准上评估了我们的 ABC 方法:一个合成的口腔病变诊断数据集和公开的 GretelAI 症状到诊断数据集。与标准基线相比,我们的方法将准确率提高了高达 46.9%,将 Brier 分数降低了 74.4%,并改善了由预期校准误差(ECE)和预测熵衡量的校准性能。

关键词

引用

@article{arxiv.2509.19375,
  title  = {Uncertainty Quantification of Large Language Models using Approximate Bayesian Computation},
  author = {Mridul Sharma and Adeetya Patel and Zaneta D' Souza and Samira Abbasgholizadeh Rahimi and Siva Reddy and Sreenath Madathil},
  journal= {arXiv preprint arXiv:2509.19375},
  year   = {2025}
}