中文

Prejudge-Before-Think:通过过程预判断提升大语言模型的测试时推理能力

计算与语言 2025-04-21 v1

摘要

本文引入了一种新的\emph{过程预判断}策略,用于展示在LLM推理中使用过程预判断是否允许模型在后续推理步骤前自适应地预见可能遇到的错误,类似于人类有时会暂停思考可能出现什么错误以及如何避免它们,而不是仅依赖试错。在具体而言,我们在论证中定义了一个预判断节点,表示一个推理步骤,至少有一个后续步骤没有通向正确答案的路径。为合成预判断推理过程,我们提出了一种自动化推理框架,采用动态树搜索策略。该框架仅需一个LLM执行答案判断、响应批判、预判断生成和思考完成。此外,我们发展了一种两阶段训练机制,包括监督微调(SFT)和强化学习(RL),进一步提升LLM的推理能力。实验结果来自竞赛级别的复杂推理,显示我们的方法能够教会模型在思考前进行预判断,并显著提升LLM的推理能力。代码和数据已发布于https://github.com/wjn1996/Prejudge-Before-Think。

关键词

引用

@article{arxiv.2504.13500,
  title  = {Prejudge-Before-Think: Enhancing Large Language Models at Test-Time by Process Prejudge Reasoning},
  author = {Jianing Wang and Jin Jiang and Yang Liu and Mengdi Zhang and Xunliang Cai},
  journal= {arXiv preprint arXiv:2504.13500},
  year   = {2025}
}