超越准确性:校准在自我改进大语言模型中的作用
计算与语言
2025-04-07 v1 人工智能
摘要
大语言模型 (LLM) 已展示出显著的自我改进能力,即通过自生成反馈不断修订其输出。尽管这种反思机制在提高任务性能方面显示出前景,但近期研究表明它可能也引入不希望的偏差——最显著的是自我偏差,即 LLM 倾向于偏好其自身先前输出。本文延续这一研究线索,通过探讨置信度估计的影响。我们评估了三种代表性的自我改进范式——基本提示、链式思维 (CoT) 提示和调优方法,并发现迭代自我改进可能导致系统性的过度自信,证据表明其期望校准误差 (ECE) 不断增加,且在高置信度时准确率较低。我们进一步探讨了将置信度校准技术与自我改进集成。具体而言,我们比较了三种策略:(1) 在多轮自我改进后应用校准,(2) 在自我改进前校准,以及 (3) 在每次自我改进步骤中应用校准。我们的结果表明,迭代校准在降低 ECE 方面最为有效,能够实现改进的校准。我们的工作从校准角度开创了自我改进 LLM 研究,为在性能和可靠性之间取得平衡提供了宝贵见解。
引用
@article{arxiv.2504.02902,
title = {Beyond Accuracy: The Role of Calibration in Self-Improving Large Language Models},
author = {Liangjie Huang and Dawei Li and Huan Liu and Lu Cheng},
journal= {arXiv preprint arXiv:2504.02902},
year = {2025}
}