思维循环:通过稳定解释衡量大语言模型置信度
计算与语言
2024-06-06 v1 机器学习
摘要
在许多高风险机器学习应用中,模型必须能够指示其对预测的不确定性。虽然大语言模型(LLM)在多种基准测试上能够达到甚至超越人类水平的准确率,但它们在错误回答上的过度自信仍然是一个有充分记录的失败模式。传统机器学习不确定性量化方法由于实现的计算成本以及许多模型的闭源性质,难以直接适应LLM。最近提出了多种黑盒方法,但这些方法通常依赖于启发式方法,例如自我表述的置信度。我们转而提出一个框架,通过衡量LLM关于答案的解释分布的不确定性来测量其不确定性。虽然利用解释本身并非新想法,但通过将每个可能的模型+解释对视为一个测试时分类器,我们可以计算这些最可能分类器上的后验答案分布。我们展示了该框架的一个具体实例,该实例使用解释蕴含作为分类器似然,在五个不同数据集上改进了置信度评分指标(特别是AURC和AUROC)。我们相信这些结果表明我们的框架既是量化LLM不确定性的有原则的方法,也是有效的方法。
引用
@article{arxiv.2406.03441,
title = {Cycles of Thought: Measuring LLM Confidence through Stable Explanations},
author = {Evan Becker and Stefano Soatto},
journal= {arXiv preprint arXiv:2406.03441},
year = {2024}
}