聊天大语言模型的概率校准不良但仍能预测多项选择问答的正确性
计算与语言
2025-08-08 v4 人工智能
机器学习
摘要
我们研究了15个经过聊天微调的大语言模型(LLM),发现它们的最大softmax概率(MSP)在多项选择问答上始终校准不良。然而,这些MSP可能仍然编码了有用的不确定性信息。具体来说,我们假设错误答案对应的MSP小于正确答案。通过严格的统计检验,我们证明这一假设对于在底层问答任务上表现良好的模型成立。我们还发现问答准确率与MSP正确性预测之间存在强方向相关性,而问答准确率与校准误差之间没有相关性。这表明在当前微调范式下,随着LLM能力的进步,我们可以预期正确性预测会提升,但校准不会。为了展示正确性预测的实用性,我们证明当模型可以选择弃权时,通过基于初始模型响应的MSP选择性弃权(仅使用少量标注数据选择MSP阈值)可以提升性能。
引用
@article{arxiv.2402.13213,
title = {Probabilities of Chat LLMs Are Miscalibrated but Still Predict Correctness on Multiple-Choice Q&A},
author = {Benjamin Plaut and Nguyen X. Khanh and Tu Trinh},
journal= {arXiv preprint arXiv:2402.13213},
year = {2025}
}
备注
Published in Transactions on Machine Learning Research (TMLR)