大语言模型不确定性量化综述:分类法、开放研究挑战与未来方向
计算与语言
2025-07-03 v2 人工智能
摘要
大语言模型(LLMs)在内容生成、编码和常识推理方面的卓越性能推动了其在社会各领域的广泛集成。然而,LLMs 的集成引发了对其可靠性和可信度的合理质疑,因为 LLMs 倾向于生成幻觉——即以显著的自信表达的、看似合理但事实不正确的回应。此前的研究表明,可以通过检查 LLM 对相关提示的不确定性来检测幻觉和其他非事实性回应,这推动了致力于量化 LLM 不确定性的重大研究努力。本综述旨在对现有的 LLM 不确定性量化方法进行广泛的回顾,识别其显著特征及其优势和劣势。我们将现有方法纳入一个相关的分类法中,统一表面上看似不同的方法以帮助理解技术现状。此外,我们强调了 LLM 不确定性量化方法的应用,涵盖聊天机器人和文本应用,以及机器人领域具身人工智能应用。我们以 LLM 不确定性量化的开放研究挑战作为结论,旨在激发未来研究。
引用
@article{arxiv.2412.05563,
title = {A Survey on Uncertainty Quantification of Large Language Models: Taxonomy, Open Research Challenges, and Future Directions},
author = {Ola Shorinwa and Zhiting Mei and Justin Lidard and Allen Z. Ren and Anirudha Majumdar},
journal= {arXiv preprint arXiv:2412.05563},
year = {2025}
}