广义正确性模型: 从历史模式学习校准且与模型无关的正确性预测器
计算与语言
2025-09-30 v1 人工智能
摘要
生成准确且校准的置信度估计对于在高风险或面向用户的应用中部署 LLM 至关重要,且仍是一个开放性挑战。先前研究通常将置信度构建为引出模型“自我认知”的问题,即 LLM 判断自身答案是否正确的能力;该方法隐含假设存在某种关于答案正确性的特权信息,且该信息可被模型自身访问。然而,我们的实验表明,试图预测自身输出正确性的 LLM,其表现通常并不优于一个无关的 LLM。此外,我们假设构建“正确性模型”(CM) 的关键因素是接触目标模型的历史预测。我们提出多种方法注入这种历史正确性信息,从而创建广义正确性模型(GCM)。我们首先表明,GCM 可以基于多个 LLM 的正确性数据进行训练,并学习适用于跨数据集和跨模型的正确性预测模式。随后,我们将 CM 作为研究正确性预测能力来源及其泛化的视角,系统控制其训练数据,发现答案措辞是正确性的强预测因子。我们进一步探索无需训练 LLM 即可注入历史的替代方法,发现将历史作为上下文示例有助于改善正确性预测,且事后校准可在校准误差上提供互补性降低。我们基于 Qwen3-8B 在 5 个模型族以及 MMLU 和 TriviaQA 数据集上评估了 GCM,并在下游选择性预测任务上进行评估,发现可靠的 LLM 置信度估计是一项通过系统编码正确性历史而习得的可泛化且与模型无关的技能,而非依赖自我内省的模型特定技能。
引用
@article{arxiv.2509.24988,
title = {Generalized Correctness Models: Learning Calibrated and Model-Agnostic Correctness Predictors from Historical Patterns},
author = {Hanqi Xiao and Vaidehi Patil and Hyunji Lee and Elias Stengel-Eskin and Mohit Bansal},
journal= {arXiv preprint arXiv:2509.24988},
year = {2025}
}
备注
Code: https://github.com/The-Inscrutable-X/CalibratedModelAgnosticCorrectness