先规划再搜索:搜索智能体需要规划
人工智能
2026-05-28 v1
摘要
将大型语言模型训练为检索增强推理智能体通常将强化学习与从更强模型蒸馏得到的SFT冷启动相结合。然而,这种范式忽略了两个基本因素:子技能之间的依赖结构,以及蒸馏并非获取能力的唯一途径的可能性。我们通过Plan来研究这一点,这是一种用于多跳检索的结构化智能体行为,它在执行任何检索之前将问题分解为有序的子问题,这样每个搜索步骤都可以锚定到预先设计的子问题上,而不会受到先前检索到的部分相关文档的影响而漂移。然而,在跨越3B到14B参数的三个模型系列中,我们发现相同的奖励信号会导致性质不同的强化学习失败模式。这一现象表明,成功的训练不仅取决于奖励设计,还取决于模型特定的可行性条件:足够的初始熵、训练稳定性和先决子技能。受此启发,我们提出了一种自举范式,其中一个小规模的种子模型生成过滤后的轨迹,从而在任何目标模型中激活Plan,消除了从外部更强模型进行蒸馏的需要。我们的流程在每个测试的模型中都激活了Plan,并在多跳问答基准测试中持续优于有竞争力的基线。
引用
@article{arxiv.2605.28354,
title = {Plan Before Search: Search Agents Need Plan},
author = {Zhipeng Qian and Zihan Liang and Yufei Ma and Ben Chen and Huangyu Dai and Jiayi Ji and Chenyi Lei and Wenwu Ou and Xiaoshuai Sun and Qibin Hou},
journal= {arXiv preprint arXiv:2605.28354},
year = {2026}
}