超越结果奖励:解耦搜索与回答提升 LLM 代理
人工智能
2025-10-07 v1
摘要
使大型语言模型 (LLM) 能够利用搜索工具是克服知识截止和幻觉等根本性限制的有前景的路径。最近的工作探索了使用强化学习 (RL) 训练搜索增强型代理,这些代理在回答之前交错进行推理和检索。这些方法通常依赖于基于结果的奖励(例如精确匹配),隐含地假设针对最终答案进行优化也会产生有效的中间搜索行为。我们的分析挑战了这一假设:我们发现基于仅限于结果的训练会导致搜索中的多个系统性缺陷,最终降低最终答案质量,包括未调用工具、无效查询和冗余搜索。为了解决这些问题,我们引入了 DeSA (Decoupling Search-and-Answering),一个简单的两阶段训练框架,显式地将搜索优化与答案生成分离。在阶段 1 中,使用检索召回率为奖励训练代理以提高搜索效果。在阶段 2 中,使用结果奖励优化最终答案的生成。跨七个 QA 基准测试,DeSA 训练的代理在搜索行为方面持续获得改进,显著高于基于结果的基线方法,实现更高的搜索召回率和答案准确率。值得注意的是,DeSA 优于同时优化召回率和结果奖励的单阶段训练方法,凸显了显式解耦这两个目标是必要的。
引用
@article{arxiv.2510.04695,
title = {Beyond Outcome Reward: Decoupling Search and Answering Improves LLM Agents},
author = {Yiding Wang and Zhepei Wei and Xinyu Zhu and Yu Meng},
journal= {arXiv preprint arXiv:2510.04695},
year = {2025}
}