中文

MaskSearch:增强智能体搜索能力的通用预训练框架

计算与语言 2025-05-28 v2

摘要

检索增强语言模型 (Retrieval-Augmented Language Models, RALMs) 代表了一种经典范式,其中模型利用通过专门模块检索到的外部知识来增强生成能力。智能体技术的最新进展使大型语言模型 (Large Language Models, LLMs) 能够自主利用工具进行检索、规划与推理。尽管现有基于训练的方法展现出前景,但其智能体能力受到训练期间使用的特定任务数据的固有特征限制。为进一步增强智能体的通用搜索能力,我们提出了一种新颖的预训练框架 MaskSearch。在预训练阶段,我们引入了检索增强掩码预测 (Retrieval Augmented Mask Prediction, RAMP) 任务,模型在该任务中学习利用搜索工具在大量预训练数据上填充掩码片段,从而为 LLMs 获取通用的检索与推理能力。此后,模型在下游任务上进行训练以实现进一步提升。我们采用监督微调 (Supervised Fine-tuning, SFT) 与强化学习 (Reinforcement Learning, RL) 进行训练。对于 SFT,我们结合基于智能体与基于蒸馏的方法生成训练数据,首先使用由规划器、重写器、观察器组成的多智能体系统,随后引入自我进化的教师模型。对于 RL,我们采用 DAPO 作为训练框架,并采用由答案奖励与格式奖励组成的混合奖励系统。此外,我们引入了一种课程学习方法,允许模型基于掩码片段的数量从简单到具有挑战性的实例逐步学习。我们在开放域多跳问答场景下评估了框架的有效性。通过大量实验,我们证明 MaskSearch 显著提升了基于 LLM 的搜索智能体在领域内与领域外下游任务上的性能。

关键词

引用

@article{arxiv.2505.20285,
  title  = {MaskSearch: A Universal Pre-Training Framework to Enhance Agentic Search Capability},
  author = {Weiqi Wu and Xin Guan and Shen Huang and Yong Jiang and Pengjun Xie and Fei Huang and Jiuxin Cao and Hai Zhao and Jingren Zhou},
  journal= {arXiv preprint arXiv:2505.20285},
  year   = {2025}
}

备注

Code is available at https://github.com/Alibaba-NLP/MaskSearch