中文

GRACE:判别器引导的思维链推理

计算与语言 2026-01-06 v3 人工智能

摘要

在多步推理(例如使用思维链)的背景下,语言模型(LMs)很容易对不正确的步骤赋予高似然。因此,优化解似然的解码策略常常产生不正确的解。为解决此问题,我们提出用正确性判别器引导思维链推理(GRACE, Guiding chain-of-thought ReAsoning with a CorrectnEss Discriminator),这是一种逐步解码方法,将解码过程导向生成正确的推理步骤。GRACE采用一个以正确与错误步骤上的对比损失训练的步级验证器或判别器,在解码时用于基于正确性对下一步候选进行打分。重要的是,GRACE仅需从LM中采样,无需LM训练或微调。使用FLAN-T5和LLaMA系列的模型,我们在四个数学推理和两个符号推理任务上评估GRACE,在大多数设定下其相较贪心解码、验证器和自一致性展现出大幅性能提升。当进一步与自一致性结合时,GRACE以可观的幅度优于所有基线。在GSM8K上的人类和LLM评估表明,GRACE不仅提升了最终答案准确率,也提升了中间推理的正确性。我们的实现可在 https://github.com/mukhal/grace 获取。

关键词

引用

@article{arxiv.2305.14934,
  title  = {GRACE: Discriminator-Guided Chain-of-Thought Reasoning},
  author = {Muhammad Khalifa and Lajanugen Logeswaran and Moontae Lee and Honglak Lee and Lu Wang},
  journal= {arXiv preprint arXiv:2305.14934},
  year   = {2026}
}

备注

Fixed typos