中文

自我纠正并非语言模型的固有能力

计算与语言 2026-01-23 v8

摘要

尽管人们对大型语言模型(LLM)的自我纠正能力越来越感兴趣,但对其有效性却有着不同的结论。先前的研究主要集中在内在自我纠正上,而外在自我纠正,特别是内部知识与外部反馈之间的相互作用,仍有待探索。在本文中,我们旨在通过回答一个基本问题来全面研究道德自我纠正的内在机制:道德自我纠正是否是 LLM 的固有能力?具体而言,我们进行了:(1) 基于自我区分任务的 LLM 道德敏感性行为分析;以及 (2) 对隐藏状态的机制分析,以检验自我纠正的关键组件(如思维链(CoT)和外部反馈)如何相互作用以促进道德自我纠正。基于行为分析和机制分析的经验证据,我们证明道德自我纠正并非 LLM 的固有能力,因为它们既不具备道德敏感性,也无法在自我纠正过程中有效结合外部反馈。

关键词

引用

@article{arxiv.2410.20513,
  title  = {Self-correction is Not An Innate Capability in Language Models},
  author = {Guangliang Liu and Zimo Qi and Xitong Zhang and Lu Cheng and Kristen Marie Johnson},
  journal= {arXiv preprint arXiv:2410.20513},
  year   = {2026}
}