大语言模型置信度估计与校准研究综述
计算与语言
2024-03-26 v2 人工智能
摘要
大语言模型(LLM)已在各领域广泛任务的范围内展现出非凡能力。尽管性能令人印象深刻,但由于生成内容中的事实错误,它们可能不可靠。评估其置信度并在不同任务中校准它们有助于缓解风险并使 LLM 产生更好的生成。近期有大量研究旨在解决此问题,但尚无全面概述对其进行组织并勾勒主要经验教训。本综述旨在弥合这一差距。特别地,我们概述了挑战并总结了 LLM 置信度估计与校准的近期技术进展。我们进一步讨论了其应用并建议了未来工作的有前景方向。
引用
@article{arxiv.2311.08298,
title = {A Survey of Confidence Estimation and Calibration in Large Language Models},
author = {Jiahui Geng and Fengyu Cai and Yuxia Wang and Heinz Koeppl and Preslav Nakov and Iryna Gurevych},
journal= {arXiv preprint arXiv:2311.08298},
year = {2024}
}
备注
16 pages, 1 page, 1 table