中文

语言模型不确定性的语义自蒸馈

计算与语言 2026-03-24 v2

摘要

大型语言模型在原则性不确定性定量化方面面临挑战,其中之一是由于其复杂性和输出的多样性。语义离散(即抽样答案意义方差)被提议作为一种有用的模型不确定性代理,但其相关计算成本在延迟关键应用中 prohibitive。我们展示,抽样得到的语义分布可以被蒸馏到轻量级学生模型中,这些模型在语言模型生成答案标记之前估计给定提示下的密度。学生模型预测答案的可能分布;该分布的熵提供了针对给定提示的不确定性信号,而概率密度允许对答案的可靠性进行评估。在TriviaQA和MMLU上的实验中,我们发现我们的学生模型在幻觉预测任务上相对于基于抽样的语义离散基线表现竞争力,同时为离域检测和多选答案选择提供了额外的不确定性原语。我们称之为语义自蒸馈(Semantic Self-Distillation, SSD),可作为处理复杂输出空间中预测不确定性的通用框架。

关键词

引用

@article{arxiv.2602.04577,
  title  = {Semantic Self-Distillation for Language Model Uncertainty},
  author = {Edward Phillips and Sean Wu and Fredrik K. Gustafsson and Boyan Gao and David A. Clifton},
  journal= {arXiv preprint arXiv:2602.04577},
  year   = {2026}
}

备注

Added experiments on MMLU dataset, investigating utility of likelihood for multiple-choice answer selection