中文

大型语言模型能否检测长链思考推理中的错误?

计算与语言 2025-04-01 v3

摘要

最近,类o1模型引起了广泛关注,这些模型会生成长链思考(Chain-of-Thought, CoT)推理步骤,以提升现有大型语言模型(LLM)的推理能力。本文为理解这些长CoT的质量,并衡量现有LLM在这些长CoT上进行批判能力方面的表现,我们引入了DeltaBench,包括来自不同类o1模型(如QwQ、DeepSeek-R1)为不同推理任务(如数学、代码、通用推理)生成的长CoT,用于衡量检测长CoT推理中错误的能力。基于DeltaBench,我们首先对生成的长CoT进行细粒度分析,发现不同类o1模型的有效性与效率。随后,我们对现有的过程奖赏模型(PRMs)和批判模型进行大规模评估,以检测每个标注过程的错误,这旨在调查现有PRMs和批判模型的边界与局限性。最后,我们希望DeltaBench能指导开发者更好地理解其模型的长CoT推理能力。

关键词

引用

@article{arxiv.2502.19361,
  title  = {Can Large Language Models Detect Errors in Long Chain-of-Thought Reasoning?},
  author = {Yancheng He and Shilong Li and Jiaheng Liu and Weixun Wang and Xingyuan Bu and Ge Zhang and Zhongyuan Peng and Zhaoxiang Zhang and Zhicheng Zheng and Wenbo Su and Bo Zheng},
  journal= {arXiv preprint arXiv:2502.19361},
  year   = {2025}
}

备注

The first four authors contributed equally, 27 pages