打开牡蛎:评估LLMs代码推理置信度的实证研究与改进
软件工程
2025-11-05 v1 人工智能
摘要
随着大型语言模型(LLM)在代码智能领域的广泛应用,越来越多的人关注其在代码推理任务中输出可靠性和可控性。置信度估计是一种有效且便捷的评估这些方面的方法。本文提出了一种针对代码推理任务的置信度分析与增强框架。我们对主流LLMs在不同任务上的置信度可靠性进行了全面实证研究,进一步评估了如提示策略优化和数学校准(如Platt Scaling)在提高置信度可靠性方面的效果。我们的结果表明,DeepSeek-Reasoner在各种任务上表现最佳,相较于其他模型在ECE、Brier Score和Performance Score方面分别提升了最高可达、和。将重新评估提示策略与Platt Scaling组合的混合策略,在上述三个指标上分别相较于原始性能提升了最高可达、和。这些结果表明,具备推理能力的模型在置信度可靠性方面表现优越,混合策略在提升各种模型的置信度可靠性方面最为有效。同时,我们阐明了不同任务复杂度、模型规模和策略对置信度性能的影响,指出当前LLMs在复杂推理任务中的置信度仍有显著提升空间。本研究不仅为LLM辅助软件工程中置信度的应用提供了研究基础和技术参考,也为未来置信度机制的优化和工程部署指明了方向。
引用
@article{arxiv.2511.02197,
title = {Open the Oyster: Empirical Evaluation and Improvement of Code Reasoning Confidence in LLMs},
author = {Shufan Wang and Xing Hu and Junkai Chen and Zhiyuan Pan and Xin Xia},
journal= {arXiv preprint arXiv:2511.02197},
year = {2025}
}
备注
13 pages, 4 figures