SAKE:基于强化学习的结构化智能体知识外推框架用于复杂LLM推理
计算与语言
2026-04-03 v4 人工智能
摘要
知识外推是通过组合和扩展现有可用知识来推断新信息的过程,这对于解决需要获取全面外部知识不切实际的专业领域中的复杂问题至关重要。我们提出SAKE(Structured Agentic Knowledge Extrapolation),一个由强化学习驱动的智能体框架,训练LLM自主检索和外推结构化知识。SAKE定义两个外部知识图谱工具:实体组构建和跨组三元组检索。模型学习在三个步骤的 rollout 中交替使用这两种检索工具:提取关键实体、筛选相关概念组,以及通过类比构建新三元组进行联想推理。整个管道使用GRPO进行端到端优化,采用课程奖励,教导模型何时检索以及如何在其上进行推理。我们的实验表明,SAKE微调的Qwen2.5-7B模型在生物医学(75.4% vs. 70.1%)和常识(81.3% vs. 74.7%)基准测试中分别超过GPT-3.5-Turbo,在智能体化知识图谱推理方面实现了最先进的性能,同时将token使用率降低了90%以上。这表明,针对不完整结构化知识的联想推理并不需要复杂的多步骤提示或大型模型,即可通过在正确工具和训练信号下进行端到端强化学习来学习。我们的代码已公开于https://anonymous.4open.science/r/SAKE-7585。
引用
@article{arxiv.2505.15062,
title = {SAKE: Structured Agentic Knowledge Extrapolation for Complex LLM Reasoning via Reinforcement Learning},
author = {Jiashu He and Jinxuan Fan and Bowen Jiang and Ignacio Houine and Dan Roth and Alejandro Ribeiro},
journal= {arXiv preprint arXiv:2505.15062},
year = {2026}
}