LLM如何检测并纠正自身错误:内部置信度信号的作用
机器学习
2026-05-04 v2
摘要
大型语言模型能够检测自身错误并在无需外部反馈的情况下进行自我纠正,但其背后的机制仍不为人知。我们通过决策神经科学中第二阶置信度模型的视角进行探讨。在一阶系统中,置信度源于生成信号本身,因此对所选响应置信度最高,无法实现错误检测。第二阶模型假设存在一个部分独立的评估信号,可与已提交的响应产生分歧,从而为错误检测提供基础。Kumaran等人(2026)表明,LLM在答案后立即缓存一种置信度表示(即答案后换行:PANL)——这会因果驱动语言置信度,并与概率日志分离。本文测试该PANL信号是否超越置信度,支持错误检测和自我纠正。我们基于第二阶框架推导预测。采用验证后纠正范式,我们发现:(i)语言置信度在/token概率日志之外预测错误检测,排除了一阶模型的解释;(ii)PANL激活在语言置信度本身之外预测错误检测;(iii)PANL预测模型可纠正哪些错误——在所有行为信号失效的地方。因果干预确认,PANL信号在答案信息被破坏时拯救了错误检测行为。所有发现均在模型(Gemma 3 27B和Qwen 2.5 7B)和任务(TriviaQA和MNLI)中复制。这些结果表明,LLM自然实现一种第二阶置信架构,其内部评估信号不仅编码答案是否可能错误,还编码模型是否具备修复该答案的知识。
引用
@article{arxiv.2604.22271,
title = {How LLMs Detect and Correct Their Own Errors: The Role of Internal Confidence Signals},
author = {Dharshan Kumaran and Viorica Patraucean and Simon Osindero and Petar Veličković and Nathaniel Daw},
journal= {arXiv preprint arXiv:2604.22271},
year = {2026}
}