基于分布对齐对抗蒸馏的大语言模型不确定性估计
计算与语言
2026-05-08 v1
摘要
大语言模型(LLM)在复杂推理和问答方面取得了快速进展,但LLM幻觉仍是阻碍实际部署的核心瓶颈,尤其是只能通过API访问的商业黑箱LLM。现有的不确定性量化方法通常依赖于计算昂贵的多次抽样或内部参数,这会导致实时估计受限,无法捕捉黑箱推理过程中隐含的信息。为此,我们提出分布对齐对抗蒸馏(Distribution-Aligned Adversarial Distillation,简称DisAAD),该方法引入生成-判别架构,引导轻量级代理模型学习黑箱LLM输出分布中高质量的区域,从而有效赋予其判断黑箱LLM是否“知道”的能力。随后,我们使用代理模型复现黑箱LLM的特定响应,并基于证据学习估计相应的不确定性。大量实验验证了我们方法的有效性与前景,表明即使只有目标LLM规模的1%大小的代理模型也能实现可靠的不确定性量化。
引用
@article{arxiv.2605.05777,
title = {Estimating the Black-box LLM Uncertainty with Distribution-Aligned Adversarial Distillation},
author = {Huizi Cui and Huan Ma and Qilin Wang and Yuhang Gao and Changqing Zhang},
journal= {arXiv preprint arXiv:2605.05777},
year = {2026}
}
备注
Accepted to ACL 2026