中文

ORACLE:基于约束引导的大语言模型推理能力优化框架

人工智能 2026-03-24 v1

摘要

使用合成推理数据训练大型语言模型(LLM)已成为提升其推理能力的热门方法,而该范式有效性的一个关键因素是生成的多步骤推理数据的质量。许多近期方法会生成合成推理路径,并依据最终答案的正确性进行筛选,常常忽视中间推理步骤中的缺陷。为增强对中间推理步骤的验证,先前工作主要依赖代码执行或符号推理引擎。然而,基于代码的验证仅限于代码或数学任务,符号推理引擎需要良好结构和完整的上下文。结果,现有方法在涉及模糊或不完整上下文的自然语言推理任务中难以发挥作用。在这些任务中,合成数据仍缺乏对每一步推理的可靠性检验。为此,我们提出ORACLE——一种受 syllogistic reasoning(三段论推理)启发的结构化数据生成框架。ORACLE将LLM的生成优势与符号监督相结合:LLM生成逐步的推理上下文,而符号推理引擎验证每一步的有效性。通过采用统一的提示模板以激发模块化推理链,ORACLE实现了细粒度的步骤级验证,促进了高质量多步骤推理数据的构建。在六项逻辑、事实和常识推理基准测试中,我们的方法在多个模型上均显著优于强大基线。

关键词

引用

@article{arxiv.2603.21140,
  title  = {ORACLE: Optimizing Reasoning Abilities of Large Language Models via Constraint-Led Synthetic Data Elicitation},
  author = {Zhuojie Yang and Wentao Wan and Keze Wang},
  journal= {arXiv preprint arXiv:2603.21140},
  year   = {2026}
}

备注

Accepted by AAAI 2026