中文

CritiCal:批评能否帮助大语言模型的不确定性或置信度校准?

计算与语言 2025-10-29 v1

摘要

大语言模型(LLM)中准确的置信度校准对于在高风险领域的安全使用至关重要,其中清晰的语言化置信度可增强用户信任。传统方法模仿参考置信度表达,往往无法捕捉准确置信度评估所需的推理。我们提出自然语言批评作为解决方案,这一方法特别适合置信度校准,因为精确的金标准置信度标签难以获得,往往需要多次生成。本文研究自然语言批评如何增强语言化置信度,回答以下问题:(1)批评什么:不确定性(问题导向)还是置信度(答案导向)?分析表明,置信度更适用于选择题任务,而不确定性在开放式场景中更为出色。(2)如何批评:自我批评还是批评校准训练?我们提出自我批评(Self-Critique),使 LLM 能够批评并优化其置信度超越仅准确率;以及 CritiCal,这是一种新颖的批评校准训练方法(CritiCal),利用自然语言批评改进置信度校准,超越直接数值优化。实验表明,CritiCal 在多个基线中均显著优于自我批评,甚至在复杂推理任务中超越其教师模型 GPT-4o。CritiCal 还在分布外设置中表现出稳健的泛化能力,推动了 LLM 的可靠性。

关键词

引用

@article{arxiv.2510.24505,
  title  = {CritiCal: Can Critique Help LLM Uncertainty or Confidence Calibration?},
  author = {Qing Zong and Jiayu Liu and Tianshi Zheng and Chunyang Li and Baixuan Xu and Haochen Shi and Weiqi Wang and Zhaowei Wang and Chunkit Chan and Yangqiu Song},
  journal= {arXiv preprint arXiv:2510.24505},
  year   = {2025}
}