置信度下的底层探索:大语言模型置信度-概率对齐性调查
计算与语言
2024-06-18 v5 人工智能
机器学习
摘要
随着大语言模型(LLM)应用的广泛化,理解其对生成响应自身置信度的评估变得日益重要,这对于模型输出的可靠性至关重要。我们提出了置信度-概率对齐(Confidence-Probability Alignment)的概念,将LLM内部置信度(由标记概率量化)与模型在明确询问其确定性时所表达的置信度联系起来。使用各种数据集和促使模型内省的提示技术,我们探测了模型内部与所表达置信度之间的对齐情况。这些技术包括使用结构化评估尺度对置信度进行评估、在提示中包含答案选项,以及引导模型对其不认识为自身输出的置信度进行评估。值得注意的是,在所分析的模型中,OpenAI的GPT-4显示出最强的置信度-概率对齐,平均Spearman's 为0.42,覆盖广泛的任务。我们的工作为促进LLM应用中的风险评估并进一步理解模型可信度提供了贡献。
引用
@article{arxiv.2405.16282,
title = {Confidence Under the Hood: An Investigation into the Confidence-Probability Alignment in Large Language Models},
author = {Abhishek Kumar and Robert Morabito and Sanzhar Umbet and Jad Kabbara and Ali Emami},
journal= {arXiv preprint arXiv:2405.16282},
year = {2024}
}
备注
9 pages (excluding references), accepted to ACL 2024 Main Conference