中文

面向自动代码修订的 LLM 置信度校准的细粒度方法

软件工程 2026-04-09 v1 人工智能

摘要

在当今 AI 辅助软件工程领域,开发者越来越依赖于高度具备能力但本质上不完美的 LLM。这些模型产生错误输出的倾向会降低开发者的生产力。为此,一种常规的缓解方法是提供能忠实反映其正确性可能性的校准置信度分数。这种信息允许用户立即做出关于输出接受、放弃错误输出或更好地将期望与模型能力对齐的决策。由于经过微调的 LLM 不会自然产生经过良好校准的置信度分数,研究人们开发了后置校准方法,其中对序列级置信度分数的全局 Platt 标定在许多生成式软件工程任务中表现良好,但在自动代码修订(ACR)此类任务(如程序修复、漏洞修复和代码优化)方面仍然不可靠或尚未得到探索。我们假设,这种传统方法的粗粒度本质使其不适用于 ACR 任务,因为正确性往往取决于局部编辑决策,且误校准可能是样本相关的,从而推动细粒度置信度校准。为此,本研究提出对三种不同细粒度置信度分数分别应用局部 Platt 标定。通过在 3 个独立任务和正确性指标上进行实验,以及使用 14 种不同规模的模型,我们发现细粒度置信度分数在更广泛的概率区间上持续实现更低的校准误差,而当全局 Platt 标定被应用后,这一效果进一步放大。我们提出的方法为从众方法提供了实用解决方案,使其在 ACR 任务中更可信地发挥 imperfect 模型的作用。

关键词

引用

@article{arxiv.2604.06723,
  title  = {Fine-grained Approaches for Confidence Calibration of LLMs in Automated Code Revision},
  author = {Hong Yi Lin and Chunhua Liu and Haoyu Gao and Patanamon Thongtanunam and Christoph Treude},
  journal= {arXiv preprint arXiv:2604.06723},
  year   = {2026}
}