不确定性作为特征缺口:上下文问答中大语言模型的认识不确定性量化
计算与语言
2025-10-27 v2 机器学习
摘要
不确定性量化(UQ)研究主要聚焦于闭卷factual问答(QA),而上下文QA尚未得到探索,尽管在实际应用中至关重要。本文聚焦于上下文QA任务的UQ,提出了一种理论上严谨的方法来量化认识不确定性。我们首先引入一种面向任务的、基于token的不确定性度量,定义为给定模型预测分布与未知真实分布之间的交叉熵。通过分解该度量,我们孤立出认识性组件,并用完美提示的理想模型近似真实分布。随后我们推导了认识不确定性的上界,并说明其可解释为给定模型隐藏表示相对于理想模型的语义特征缺口。我们进一步将该通用框架应用于上下文QA任务,并假设三个特征近似该缺口:context-reliance(使用提供的上下文而非参数知识)、context comprehension(从上下文中提取相关信息)以及honesty(避免刻意说谎)。通过自上而下的可解释性方法,我们仅用少量标记样本提取这些特征,并对其进行集成以形成稳健的不确定性得分。在多个QA基准的in-distribution和out-of-distribution设置实验中显示,我们的方法在多个方面均显著优于最先进的无监督(无抽样和有抽样)和监督UQ方法,实现了最高达13分的PRR提升,同时推理开销可忽略不计。
关键词
引用
@article{arxiv.2510.02671,
title = {Uncertainty as Feature Gaps: Epistemic Uncertainty Quantification of LLMs in Contextual Question-Answering},
author = {Yavuz Bakman and Sungmin Kang and Zhiqi Huang and Duygu Nur Yaldiz and Catarina G. Belém and Chenyang Zhu and Anoop Kumar and Alfy Samuel and Salman Avestimehr and Daben Liu and Sai Praneeth Karimireddy},
journal= {arXiv preprint arXiv:2510.02671},
year = {2025}
}