中文

LogicReward:通过逐步逻辑监督激励 LLM 推理

计算与语言 2026-01-30 v2

摘要

尽管大语言模型展现出强大的推理能力,但现有的训练方法主要依赖结果导向的反馈,可能生成正确的答案但推理过程存在缺陷。先前的工作对中间步骤进行监督,但仍缺乏逻辑严谨性的保证,而在逻辑一致性至关重要的高风险场景中这一点尤为重要。为此,我们提出了 LogicReward,一种通过定理证明器 enforce 步骤级逻辑正确性来指导模型训练的新型奖励系统。我们进一步引入了软统一的自动形式化方法,减少自然语言的歧义并提高形式化质量,从而更有效地利用定理证明器。使用 LogicReward 构建的数据训练的 8B 参数模型在自然语言推理和逻辑推理任务上,分别比 GPT-4o 和 o4-mini 高出 11.6% 和 2%。进一步分析表明,LogicReward 增强了推理的忠实性,提高了对未见任务(如数学和常识推理)的可泛化性,并且即使没有 ground-truth 标签也能提供可靠的奖励信号。我们将在 https://llm-symbol.github.io/LogicReward 上发布所有数据和代码。

关键词

引用

@article{arxiv.2512.18196,
  title  = {LogicReward: Incentivizing LLM Reasoning via Step-Wise Logical Supervision},
  author = {Jundong Xu and Hao Fei and Huichi Zhou and Xin Quan and Qijun Huang and Shengqiong Wu and William Yang Wang and Mong-Li Lee and Wynne Hsu},
  journal= {arXiv preprint arXiv:2512.18196},
  year   = {2026}
}

备注

ICLR 2026