Critic-CoT:通过链式思维评论机制提升大语言模型的推理能力
计算与语言
2025-06-12 v3
摘要
自我批评已成为增强大语言模型推理性能的关键机制。然而,当前方法主要涉及针对直观实例反馈的基本提示,这类似于系统1过程,限制了推理能力。此外,缺乏对大语言模型批评能力与任务解决性能之间关系的深入调查。为此,我们提出Critic-CoT,一种新型框架,将大语言模型推进至类似系统2的批评能力。通过逐步的链式思维推理范式和自动构建的远端监督数据(无需人工标注),Critic-CoT使大语言模型能够进行慢速、分析性的自我批评和细化,从而提升其推理能力。在GSM8K和MATH数据集上的实验表明,我们增强的模型通过过滤无效解决方案或迭代细化,显著提升了任务解决性能。此外,我们进一步探讨了批评能力与任务解决能力在大语言模型中的内在相关性,发现这两种能力可以相互强化而非相互冲突。
引用
@article{arxiv.2408.16326,
title = {Critic-CoT: Boosting the reasoning abilities of large language model via Chain-of-thoughts Critic},
author = {Xin Zheng and Jie Lou and Boxi Cao and Xueru Wen and Yuqiu Ji and Hongyu Lin and Yaojie Lu and Xianpei Han and Debing Zhang and Le Sun},
journal= {arXiv preprint arXiv:2408.16326},
year = {2025}
}
备注
Accepted at ACL 2025 Findings