面向知识图谱问答的模式感知累积过程奖励模型 SCPRM
人工智能
2026-05-05 v1
摘要
大型语言模型在复杂推理方面表现出色,但对其中间步骤的评估仍具有挑战。虽然过程奖励模型提供逐步监督,但往往会出现风险补偿效应,即后续正确步骤会抵消错误步骤,导致对不完善推理路径赋予高奖励。在知识图谱 (KG) 推理中,这一问题更为突出,因为 KG 中可能存在从起始实体到终端实体的多条路径,错误的推理步骤可能导致路径失效。为解决这些问题,我们提出了模式感知累积过程奖励模型 (SCPRM),其评估推理路径时会依据推理前缀进行条件化,并纳入当前推理步骤与从查询中隐式解析出的目标之间的模式距离,从而为路径探索提供累积和未来奖励。我们进一步将 SCPRM 集成到蒙特卡洛树搜索 (MCTS) 中作为 SCPRM-MCTS,用于在知识图谱上进行多跳推理以完成问答任务。在医学和法律 KGQA 以及 CWQ 数据集上,SCPRM-MCTS 相对于强大基线提高了 Hits@k 指标平均提升 1.18%,表明其更准确地进行风险敏感推理评估。
引用
@article{arxiv.2605.02819,
title = {SCPRM: A Schema-aware Cumulative Process Reward Model for Knowledge Graph Question Answering},
author = {Jiujiu Chen and Yazheng Liu and Sihong Xie and Hui Xiong},
journal= {arXiv preprint arXiv:2605.02819},
year = {2026}
}