GrACE: 大语言模型中基于生成的置信度挖掘与高效测试时扩展方法
计算与语言
2026-04-08 v2
摘要
通过置信度挖掘来评估大语言模型(LLM)的可靠性是AI安全在高风险应用中(如医疗和金融)所关注的热门方法。现有方法要么需要高昂的计算开销,要么存在校准不良,导致在实际部署中既不实用又不可靠。本文提出GrACE,一种面向置信度挖掘的生成方法,使其为LLM提供可扩展且可靠的置信度挖掘。GrACE采用一种新机制,即模型通过最后一个隐藏状态与词汇表中附加的特殊标记的嵌入之间的相似度来表达置信度,实时进行。我们对模型进行微调,以校准与准确率相关的置信度。大量实验表明,GrACE产生的置信度在不依赖额外抽样或辅助模型的情况下,在开放式生成任务中实现最佳的判别能力和校准能力。此外,我们提出两种基于置信度的测试时扩展策略,这不仅提高了最终决策的准确率,还显著减少了所需抽样次数,凸显其作为具有可靠、即时置信度估计的LLM部署解决方案的潜力。
引用
@article{arxiv.2509.09438,
title = {GrACE: A Generative Approach to Better Confidence Elicitation and Efficient Test-Time Scaling in Large Language Models},
author = {Zhaohan Zhang and Ziquan Liu and Ioannis Patras},
journal= {arXiv preprint arXiv:2509.09438},
year = {2026}
}