DSPO:用于智能体搜索与推理的稳定高效策略优化
计算与语言
2026-03-20 v4
摘要
增强大语言模型主动搜索外部知识的能力对于复杂和真实世界任务至关重要。当前方法要么依赖提示来激发模型固有的智能体能力,要么在将强化学习应用于复杂交互任务时遭遇性能瓶颈和崩溃,使其真正的智能体潜力未被充分释放。为此,我们引入了动态过滤序列级策略优化(DSPO),一种改进的强化学习算法,旨在通过序列级优化和动态样本过滤实现稳健的智能体训练。我们纯粹通过强化学习训练模型以交织多轮搜索与推理,无需监督演示数据。在多个问答基准上,我们的 7B 模型相比可比先前工作提升了 34.1%,并且在复杂多跳问答(如 HotpotQA)上甚至超越了先前工作中的 14B 模型近 9% 的相对提升,同时保持了出色的训练稳定性。
引用
@article{arxiv.2510.09255,
title = {DSPO: Stable and Efficient Policy Optimization for Agentic Search and Reasoning},
author = {Chenyang Gu and Yewen Pu and Bruce Yang and Xiaofan Li and Huan Gao},
journal= {arXiv preprint arXiv:2510.09255},
year = {2026}
}