中文

PRISMA:面向开放域多跳问答的多智能体架构中强化学习引导的两阶段策略优化

人工智能 2026-01-12 v1

摘要

在海量语料库上回答真实世界的开放域多跳问题是检索增强生成(RAG)系统面临的关键挑战。近期研究采用强化学习(RL)端到端地优化检索增强的推理过程,直接增强其解决复杂查询的能力。然而,可靠部署受到两个障碍的阻碍。1)检索崩溃:在没有推理引导规划的情况下,对大型语料库的迭代检索无法定位包含桥接答案的中间证据,导致下游推理崩溃。2)学习不稳定性:端到端的轨迹训练遭受跨推理链的弱信用分配和跨模块的差错误定位,导致对基准特定启发式方法的过拟合,限制了可迁移性和稳定性。为了解决这些问题,我们提出了PRISMA,一个解耦的RL引导框架,具有计划-检索-检查-解决-记忆架构。PRISMA的优势在于推理引导的协作:检查器提供基于推理的反馈,以细化规划器的分解和细粒度检索,同时在求解器中强制执行基于证据的推理。我们通过两阶段组相对策略优化(GRPO)来优化个体智能体的能力。第一阶段将规划器和求解器校准为规划和推理方面的专门专家,而第二阶段利用观察感知残差策略优化(OARPO)来增强检查器验证上下文和触发定向恢复的能力。实验表明,PRISMA在十个基准测试上达到了最先进的性能,并且可以在真实场景中高效部署。

关键词

引用

@article{arxiv.2601.05465,
  title  = {PRISMA: Reinforcement Learning Guided Two-Stage Policy Optimization in Multi-Agent Architecture for Open-Domain Multi-Hop Question Answering},
  author = {Yu Liu and Wenxiao Zhang and Cong Cao and Wenxuan Lu and Fangfang Yuan and Diandian Guo and Kun Peng and Qiang Sun and Kaiyan Zhang and Yanbing Liu and Jin B. Hong and Bowen Zhou and Zhiyuan Ma},
  journal= {arXiv preprint arXiv:2601.05465},
  year   = {2026}
}