中文

D$^2$Plan:复杂检索增强推理的双智能体动态全局规划

计算与语言 2026-01-14 v1

摘要

最近一批在强化学习(RL)训练的搜索增强型 LLM 可以交叉进行搜索和推理,以解决多跳推理任务。但它们面临两个关键失效模式:随着上下文不断积累,既包含关键证据又包含无关信息,导致(1)搜索链构建不有效,产生错误查询或遗漏关键信息的检索,以及(2)被边缘证据劫持,导致模型误将干扰项识别为有效证据。为此,我们提出了 **D2^2Plan**,即 **D**ual-agent **D**ynamic global **P**lanning(双智能体动态全局规划)范式,用于复杂检索增强推理。**D2^2Plan** 通过 *Reasoner*(推理者)和 *Purifier*(净化者)的协作实现:*Reasoner* 在推理过程中构建显式的全局计划,并根据检索反馈动态调整计划;*Purifier* 评估检索相关性并精炼关键信息供 *Reasoner* 使用。我们进一步引入了两阶段训练框架,包括监督微调(SFT)冷启动(cold-start)于合成轨迹,以及基于计划导向奖励的 RL,以教导 LLM 掌握 **D2^2Plan** 范式。广泛实验表明,**D2^2Plan** 实现了更连贯的多步骤推理和更强的对无关信息的鲁棒性,从而在具有挑战性的 QA 基准任务中取得优异性能。

关键词

引用

@article{arxiv.2601.08282,
  title  = {D$^2$Plan: Dual-Agent Dynamic Global Planning for Complex Retrieval-Augmented Reasoning},
  author = {Kangcheng Luo and Tinglang Wu and Yansong Feng},
  journal= {arXiv preprint arXiv:2601.08282},
  year   = {2026}
}