中文

超越准确性:校准在自我改进大语言模型中的作用

计算与语言 2025-04-07 v1 人工智能

摘要

大语言模型 (LLM) 已展示出显著的自我改进能力,即通过自生成反馈不断修订其输出。尽管这种反思机制在提高任务性能方面显示出前景,但近期研究表明它可能也引入不希望的偏差——最显著的是自我偏差,即 LLM 倾向于偏好其自身先前输出。本文延续这一研究线索,通过探讨置信度估计的影响。我们评估了三种代表性的自我改进范式——基本提示、链式思维 (CoT) 提示和调优方法,并发现迭代自我改进可能导致系统性的过度自信,证据表明其期望校准误差 (ECE) 不断增加,且在高置信度时准确率较低。我们进一步探讨了将置信度校准技术与自我改进集成。具体而言,我们比较了三种策略:(1) 在多轮自我改进后应用校准,(2) 在自我改进前校准,以及 (3) 在每次自我改进步骤中应用校准。我们的结果表明,迭代校准在降低 ECE 方面最为有效,能够实现改进的校准。我们的工作从校准角度开创了自我改进 LLM 研究,为在性能和可靠性之间取得平衡提供了宝贵见解。

关键词

引用

@article{arxiv.2504.02902,
  title  = {Beyond Accuracy: The Role of Calibration in Self-Improving Large Language Models},
  author = {Liangjie Huang and Dawei Li and Huan Liu and Lu Cheng},
  journal= {arXiv preprint arXiv:2504.02902},
  year   = {2025}
}