解决自然语言生成不确定性估计方法评估中的陷阱
机器学习
2025-10-24 v2 人工智能
摘要
幻觉是削弱大语言模型 (LLM) 可靠性的常见问题。最近的研究识别出幻觉的一个特定子集,称为虚构,它是由于 LLM 的预测不确定性产生的。为了检测虚构,人们已经开发了多种用于估计自然语言生成 (NLG) 中预测不确定性的方法。这些方法通常通过将不确定性估计与生成文本的正确性相关联来进行评估,并以问答 (QA) 数据集作为标准基准。然而,常用的近似正确性函数之间存在显著的分歧,并因此在不确定性估计方法的排名上也存在分歧。这使得人们可以夸大不确定性估计方法的表观性能。我们提议在风险相关性实验中使用几种替代风险指标,以提高 NLG 的 UE 算法经验评估的鲁棒性。对于 QA 任务,我们表明在多个 LLM-as-a-judge 变体上进行边缘化可以减少评估偏差。此外,我们探索了结构化任务以及分布外和扰动检测任务,它们提供了鲁棒且可控的风险指标。最后,我们提议使用不确定性估计方法的 Elo 评级,以在广泛的评估设置下提供客观的总结。
引用
@article{arxiv.2510.02279,
title = {Addressing Pitfalls in the Evaluation of Uncertainty Estimation Methods for Natural Language Generation},
author = {Mykyta Ielanskyi and Kajetan Schweighofer and Lukas Aichberger and Sepp Hochreiter},
journal= {arXiv preprint arXiv:2510.02279},
year = {2025}
}
备注
Preprint, under review