DPRM:多跳问答中的双重隐式过程奖励模型
计算与语言
2025-12-02 v2 人工智能
摘要
在多跳问答(MHQA)任务中,思维链通过引导大型语言模型进行多步推理来提升生成质量,而知识图谱则通过语义匹配减少幻觉。结果奖励模型在生成最终答案后提供反馈,但无法评估多步推理的过程。传统的过程奖励模型评估推理过程,但需要昂贵的人工标注或展开生成。隐式 PRM 仅使用结果信号进行训练,并通过奖励参数化推导步骤奖励而无需显式标注,因此更适合 MHQA 任务中的多步推理。然而,现有的隐式 PRM 仅在纯文本场景中得到了探索。当适应 MHQA 任务时,它无法处理 KG 中的图结构约束,也无法捕获 CoT 与 KG 路径之间潜在的不一致性。为了解决这些局限性,我们提出了 DPRM(双重隐式过程奖励模型)。它为 MHQA 任务中的 CoT 和 KG 推理训练了两个隐式 PRM。这两个 PRM 分别名为 KG-PRM 和 CoT-PRM,它们通过奖励参数化从结果信号中推导出步骤级奖励,无需额外的显式标注。其中,KG-PRM 使用偏好对来学习 KG 的结构约束。DPRM 进一步引入了 CoT 和 KG 推理步骤之间的一致性约束,使两个 PRM 相互验证并协同优化推理路径。我们还提供了过程奖励推导的理论证明。实验结果表明,我们的方法在多个数据集上优于 13 个基线,在 Hit@1 上实现了高达 16.6% 的提升。
引用
@article{arxiv.2511.08364,
title = {DPRM: A Dual Implicit Process Reward Model in Multi-Hop Question Answering},
author = {Xinyi Wang and Yiping Song and Zhiliang Tian and Bo Liu and Tingjin Luo and Minlie Huang},
journal= {arXiv preprint arXiv:2511.08364},
year = {2025}
}