中文

GrepSeek:用于直接语料库交互的搜索代理训练

计算与语言 2026-05-29 v1 人工智能 信息检索 机器学习

摘要

大型语言模型(LLM)搜索代理通过多轮推理和信息检索在知识密集型语言任务中展现出强大的潜力。大多数现有系统通过检索器获取关键词或自然语言查询并返回基于预计算文档表示的排序文档列表来访问信息。本文探索了另一视角,即搜索代理将语料库本身视为搜索环境,通过发布可执行shell命令来寻找证据。我们引入GrepSeek,一个优化的直接语料库交互(DCI)搜索代理,训练紧凑搜索代理从大型文本语料库中寻找、筛选和组合证据。为解决在大型语料库上直接进行强化学习导致行为不稳定的挑战,我们提出了两阶段训练管道。首先,我们利用答案感知的Tutor和答案盲目Planner构建冷启动数据集,以生成已验证的、因果导向的搜索轨迹。其次,我们使用组相对策略优化(GRPO)细化初始化的策略,使代理通过直接与语料库交互改进其任务导向的搜索行为。为使DCI在规模上实用,我们进一步使用语义保持的分片并行执行引擎,通过最高7.6×7.6\times加速shell-based检索,同时保持与顺序执行shell命令的逐字节等价性。在七个开放域问答基准测试中,GrepSeek实现了最强的整体token级F1F_1和精确匹配。我们的分析还突显了纯词汇交互在查询表面形式显著变化时的局限性,表明DCI是一种实用且具竞争力的方法,可与现有检索范式相互补充。

关键词

引用

@article{arxiv.2605.29307,
  title  = {GrepSeek: Training Search Agents for Direct Corpus Interaction},
  author = {Alireza Salemi and Chang Zeng and Atharva Nijasure and Jui-Hui Chung and Razieh Rahimi and Fernando Diaz and Hamed Zamani},
  journal= {arXiv preprint arXiv:2605.29307},
  year   = {2026}
}