中文

知识图谱是隐式奖励模型:路径导出信号实现组合推理

人工智能 2026-03-09 v3 计算与语言

摘要

大型语言模型在数学和编程等结构化推理领域已达到接近专家的水平,但其在专业科学领域执行组合多跳推理的能力仍然有限。我们提出了一种自下而上的学习范式,其中模型以公理化领域事实为基础,并将其组合以解决复杂的、未见的任务。为此,我们提出了一种结合监督微调和强化学习 (RL) 的训练后流水线,其中知识图谱充当隐式奖励模型。通过从知识图谱路径中导出新颖的奖励信号,我们提供了可验证、可扩展且有根据的监督,鼓励模型在 RL 期间组合中间公理,而不是仅优化最终答案。我们在医学领域验证了这种方法,在短跳推理路径(1-3 跳)上训练了一个 14B 模型,并评估了其对复杂多跳查询(4-5 跳)的零样本泛化能力。我们的实验表明,路径导出的奖励充当了“组合桥梁”,使我们的模型在最困难的推理任务上显著优于大得多的模型以及 GPT-5.2 和 Gemini 3 Pro 等前沿系统。此外,我们证明了我们的方法对针对选项重排压力测试的对抗性扰动具有鲁棒性。这项工作表明,将推理过程建立在结构化知识基础之上是实现智能推理的可扩展且高效的路径。我们的代码公开于:https://github.com/jha-lab/kg-implicit-reward-compositional-rl/。

关键词

引用

@article{arxiv.2601.15160,
  title  = {Knowledge Graphs are Implicit Reward Models: Path-Derived Signals Enable Compositional Reasoning},
  author = {Yuval Kansal and Niraj K. Jha},
  journal= {arXiv preprint arXiv:2601.15160},
  year   = {2026}
}