中文

自我纠错能力的置信度与批判性分析:一种分解方法

计算与语言 2024-12-30 v1

摘要

大型语言模型(LLM)可以纠正自生成的响应,但也会出现自纠错后准确率下降的情况。为深入理解自纠错现象,本文致力于分解、评估和分析LLM的自纠错行为。通过枚举和分析自纠错前后的答案正确性,我们将自纠错能力分解为置信度(对纠正答案的把握程度)和批判性(将错误答案转化为正确答案的能力)两大能力,并从概率角度提出两种度量指标来衡量这两项能力,另外还有一个用于整体自纠错能力评估的指标。基于我们的分解和评估指标,我们开展了大量实验并得出若干经验性结论。例如,我们发现不同模型可能展现出不同的行为:有的模型表现得很自信,而另一些模型则更批判。我们也发现,当通过提示或零样本学习操纵模型自纠错行为时,两项能力之间会存在权衡(即提升一项能力可能导致另一项能力下降)。进一步地,我们发现一种简单且高效的策略通过转换监督微调(SFT)数据格式来提升自纠错能力,该策略在两项能力和事后准确率上均优于基础SFT。我们的代码将在GitHub上公开。

关键词

引用

@article{arxiv.2412.19513,
  title  = {Confidence v.s. Critique: A Decomposition of Self-Correction Capability for LLMs},
  author = {Zhe Yang and Yichang Zhang and Yudong Wang and Ziyao Xu and Junyang Lin and Zhifang Sui},
  journal= {arXiv preprint arXiv:2412.19513},
  year   = {2024}
}

备注

16 pages, 10 figures