通过一行代码提升搜索代理性能
机器学习
2026-03-12 v1 计算与语言
摘要
基于工具的智能体强化学习 (TARL) 作为一种训练用于与外部工具交互以实现自主多轮信息寻求过程的搜索代理的新兴范式,然而我们识别出导致灾难性模型崩溃的关键训练不稳定性:重要性抽样分布漂移 (ISDD)。 在广泛采用的 TARL 算法之一——群体相对策略优化 (GRPO) 中,ISDD 表现为重要性抽样比率的急剧下降,这会使梯度更新失效并触发不可逆的训练失败。为解决此问题,我们提出了一种方法,即**S**earch **A**gent **P**olicy **O**ptimization (**SAPO**),通过条件标记级 KL 约束来稳定训练。不同于忽略分布差异的硬性裁剪,SAPO 有选择地对当前策略与旧策略之间的 KL 散度进行惩罚。关键在于,该惩罚仅应用于概率较低且具有低概率的正标记上,从而防止分布漂移同时保持梯度流。值得注意的是,SAPO 只需对标准 GRPO 进行一行代码的修改即可实现,确保可立即部署。广泛的实验在七个 QA 基准测试中表明,SAPO 相对于 Search-R1 实现了 **+10.6% 绝对提升**(+31.5% 相对提升),在不同模型规模(1.5B、14B)和不同模型家族(Qwen、LLaMA)中均实现一致的收益。
引用
@article{arxiv.2603.10069,
title = {Improving Search Agent with One Line of Code},
author = {Jian Li and Dongsheng Chen and Zhenhua Xu and Yizhang Jin and Jiafu Wu and Chengjie Wang and Xiaotong Yuan and Yabiao Wang},
journal= {arXiv preprint arXiv:2603.10069},
year = {2026}
}