中文

AI-SearchPlanner:基于帕累托最优多目标强化学习的模块化智能体搜索

人工智能 2025-12-30 v4

摘要

近期的研究探索了将大型语言模型(LLM)与搜索引擎集成,以同时利用 LLM 的内部预训练知识和外部信息。特别是,强化学习(RL)已成为通过与搜索引擎的多轮交互来增强 LLM 推理的一种有前景的范式。然而,现有的基于 RL 的搜索智能体依赖单个 LLM 以端到端的方式同时处理搜索规划和问答(QA)任务,这限制了它们同时优化这两种能力的能力。在实践中,复杂的 AI 搜索系统通常采用大型冻结的 LLM(例如 GPT-4、DeepSeek-R1)以确保高质量的 QA。因此,一种更有效且高效的方法是利用专用于搜索规划的小型可训练 LLM。在本文中,我们提出了 \textbf{AI-SearchPlanner},一种新颖的强化学习框架,旨在通过专注于搜索规划来提升冻结 QA 模型的性能。具体而言,我们的方法引入了三项关键创新:1)解耦搜索规划器与生成器的架构,2)搜索规划的双奖励对齐,以及 3)规划效用与成本的 Pareto 优化,以实现这些目标。在真实世界数据集上的大量实验表明,AI SearchPlanner 在有效性和效率上均优于现有的基于 RL 的搜索智能体,同时在不同冻结 QA 模型和数据领域上展现出强大的泛化能力。

关键词

引用

@article{arxiv.2508.20368,
  title  = {AI-SearchPlanner: Modular Agentic Search via Pareto-Optimal Multi-Objective Reinforcement Learning},
  author = {Lang Mei and Zhihan Yang and Xiaohan Yu and Huanyao Zhang and Chong Chen},
  journal= {arXiv preprint arXiv:2508.20368},
  year   = {2025}
}