中文

关于大语言模型道德自我纠正收敛性的研究

计算与语言 2025-10-28 v3 机器学习

摘要

大型语言模型(LLM)能够在得到指令后改进其响应,这一能力称为自我纠正。当指令仅提供一般且抽象的目标,而不关于响应潜在问题的具体细节时,LLM必须依赖其内部知识来改进响应质量,这一过程被称为内在自我纠正。内在自我纠正在各种应用中取得的经验成功性已显而易见,但其有效性的作用机制仍未为人所知。本文聚焦于LLM中的道德自我纠正,揭示了内在自我纠正确性的一个关键特征:通过多轮交互实现性能收敛;并对这种收敛行为提供了机制性分析。基于我们的实验结果和分析,我们发现收敛的底层机制是:持续注入的自我纠正指令激活道德概念,从而降低模型不确定性,导致随着激活道德概念在后续轮次中趋于稳定的收敛性能。本文通过表明道德自我纠正具有性能收敛这一理想属性,展示了其强大的潜力。

关键词

引用

@article{arxiv.2510.07290,
  title  = {On the Convergence of Moral Self-Correction in Large Language Models},
  author = {Guangliang Liu and Haitao Mao and Bochuan Cao and Zhiyu Xue and Xitong Zhang and Rongrong Wang and Kristen Marie Johnson},
  journal= {arXiv preprint arXiv:2510.07290},
  year   = {2025}
}

备注

17 pages, 7 figures