大语言模型问答中自然语言解释的不确定性量化
计算与语言
2025-09-22 v1 机器学习
摘要
大语言模型(LLM)在问答(QA)任务中展现出强大能力,能够提供简洁、上下文感知的答案。复杂LLM缺乏透明度激发了大量旨在开发解释大语言行为方法的研究。在现有解释方法中,自然语言解释因其能够以自解释方式解释LLM并即使在模型为闭源时也能理解模型行为而脱颖而出。然而,尽管这些进展前景广阔,尚无现有工作研究如何为这些生成的自然语言解释提供有效的不确定性保证。这种不确定性量化对于理解这些解释背后的置信度至关重要。值得注意的是,由于LLM的自回归生成过程和医学查询中噪声的存在,为自然语言解释生成有效的不确定性估计尤为困难。为弥补这一空白,本工作中,我们首先提出了一种针对这些生成的自然语言解释的新颖不确定性估计框架,以事后和模型无关的方式提供有效的不确定性保证。此外,我们还设计了一种新颖的鲁棒不确定性估计方法,即使在噪声下也能保持有效的不确定性保证。QA任务上的大量实验证明了我们方法的期望性能。
引用
@article{arxiv.2509.15403,
title = {Quantifying Uncertainty in Natural Language Explanations of Large Language Models for Question Answering},
author = {Yangyi Li and Mengdi Huai},
journal= {arXiv preprint arXiv:2509.15403},
year = {2025}
}