中文

当 LLM 对其答案感到担忧——以及其不确定性何时是合理的

计算与语言 2025-03-04 v1 机器学习

摘要

不确定性估计对于评估大语言模型(LLM)至关重要,尤其是在错误答案可能导致重大后果的高风险领域。大量方法致力于解决此问题,但关注的仅是特定类型的不确定性,忽略了其他类型。我们研究了具体的估计方法,包括基于 token 的熵和模型即裁判(model-as-judge, MASJ)技术,针对不同的题目主题在多选题回答任务中如何表现。我们的实验考虑了来自1.5B至72B参数规模的三个 LLM:Phi-4、Mistral 和 Qwen,以及14个题目主题。尽管MASJ的表现类似于随机错误预测器,但响应熵在知识依赖领域预测模型错误,成为有效的难题难度指示器:在生物学领域ROC-AUC为0.73。而在推理依赖领域(数学题目)中,该相关性消失,ROC-AUC为0.55。更重要的是,我们发现熵度量需要推理能力。因此,数据不确定性相关的熵应被整合到不确定性估计框架中,而MASJ则需要进一步完善。此外,现有的MMLU-Pro样本存在偏差,应在不同子领域之间平衡所需推理量,以更公平地评估 LLM的性能。

关键词

引用

@article{arxiv.2503.01688,
  title  = {When an LLM is apprehensive about its answers -- and when its uncertainty is justified},
  author = {Petr Sychev and Andrey Goncharov and Daniil Vyazhev and Edvard Khalafyan and Alexey Zaytsev},
  journal= {arXiv preprint arXiv:2503.01688},
  year   = {2025}
}