中文

通过多视角反思提升大语言模型的自我纠错能力

计算与语言 2026-01-13 v1

摘要

虽然链式思维(Chain-of-Thought, CoT) prompting 推动了 LLM 的推理能力,但在一致性、准确性和自我纠错方面仍面临挑战,尤其是针对复杂或伦理敏感任务。现有的单维反思方法改进有限。我们提出 MyGO 多视角反思链式思维(PR-CoT),一种新型方法,采用结构化的多视角反思。初始 CoT 后,PR-CoT 指导 LLM 跨多个预定义角度进行自我评估:逻辑一致性、信息完整性、偏见/伦理以及备选方案。该方法纯净基于提示工程实现,无需模型再训练,即可将初始 CoT 优化为更稳健、更准确的最终答案。实验在算术、常识、伦理决策和逻辑谜题方面进行,使用 GPT-3.5 和 GPT-4 模型,表明 PR-CoT 在逻辑一致性和错误纠正方面显著优于传统 CoT 和现有反思方法,在伦理决策等细粒度领域取得显著提升。消融实验、人类评估和定性分析进一步验证了每个反思视角及整体多反思范式在促进可靠 LLM 推理方面的贡献。

关键词

引用

@article{arxiv.2601.07780,
  title  = {Enhancing Self-Correction in Large Language Models through Multi-Perspective Reflection},
  author = {Mariana Costa and Alberlucia Rafael Soarez and Daniel Kim and Camila Ferreira},
  journal= {arXiv preprint arXiv:2601.07780},
  year   = {2026}
}