三思而行?过度推理损害置信度校准
人工智能
2025-08-22 v1 计算与语言
摘要
作为问答工具部署的大语言模型需要稳健的校准以避免过度自信。我们使用 ClimateX 数据集(Lacombe 等人,2023)并将其扩展到人类与地球健康领域,系统地评估了推理能力和推理预算如何影响置信度评估的准确性。我们的核心发现挑战了“测试时扩展”范式:虽然最新的推理大语言模型在评估专家置信度方面达到了 48.7% 的准确率,但增加推理预算始终损害而非改善校准效果。扩展推理会导致系统性的过度自信,这种过度自信随着推理预算的增加而加剧,在适度的计算投入之外产生递减甚至负面的回报。相反,搜索增强生成的表现远超纯粹推理,通过检索相关证据达到了 89.3% 的准确率。我们的结果表明,对于知识密集型任务的置信度校准改进,信息获取而非推理深度或推理预算,可能是关键的瓶颈。
引用
@article{arxiv.2508.15050,
title = {Don't Think Twice! Over-Reasoning Impairs Confidence Calibration},
author = {Romain Lacombe and Kerrie Wu and Eddie Dilworth},
journal= {arXiv preprint arXiv:2508.15050},
year = {2025}
}
备注
Published at ICML 2025 Workshop on Reliable and Responsible Foundation Models