中文

Self-Correction Bench:揭示并解决大语言模型中的自校正盲点

计算与语言 2025-10-07 v2 人工智能 机器学习

摘要

尽管大语言模型(LLMs)已彻底改变了人工智能,它们仍会犯错并可能探索无效的推理路径。自校正能力对于在安全关键应用中部署 LLMs 至关重要。我们揭示了一种系统性失败:LLMs 无法校正其自身输出中的错误,却能成功校正来自外部的相同错误——我们将这一局限称为自校正盲点(Self-Correction Blind Spot)。为研究这一现象,我们引入 Self-Correction Bench,一个通过在三个复杂度层级进行受控错误注入来衡量该现象的评估框架。在对 14 个开源非推理模型的测试中,我们发现平均 64.5% 的盲点率。我们提供多项证据表明,这一局限可能受到训练数据的影响:人类示范很少包含纠错序列(更倾向于无错响应),而通过强化学习(RL)训练的模型则通过结果反馈学习纠错。值得注意的是,附加一个极简的 "Wait" 提示即可激活 89.3% 的盲点减少,表明存在需要触发才能激活的潜在能力。我们的工作凸显了一个可能受训练分布影响的关键局限,并提供了一种增强 LLM 可靠性与可信度的实用方法——这对安全关键领域至关重要。

关键词

引用

@article{arxiv.2507.02778,
  title  = {Self-Correction Bench: Uncovering and Addressing the Self-Correction Blind Spot in Large Language Models},
  author = {Ken Tsui},
  journal= {arXiv preprint arXiv:2507.02778},
  year   = {2025}
}

备注

26 pages, 16 figures