Fathom-DeepResearch:为 SLM 释放长程信息检索与综合能力
人工智能
2025-09-30 v1 机器学习
摘要
工具集成推理已成为实现智能体应用的关键焦点。其中,DeepResearch Agents 因其在复杂、开放式信息搜寻任务上的优异表现而备受关注。我们提出 Fathom-DeepResearch,一个由两个专用模型组成的智能体系统。第一个是 Fathom-Search-4B,一个基于 Qwen3-4B 训练的 DeepSearch 模型,通过实时网络搜索和定向网页查询优化基于证据的调查。其训练结合了三项进展: DUETQA,一个通过多智能体自博弈生成的 5K 样本数据集,强制要求严格的网络搜索依赖和异构来源支撑; RAPO,GRPO 的零开销扩展,通过课程剪枝、奖励感知优势缩放和逐提示重放缓冲区,稳定多轮强化学习与可验证奖励; 可导向的步级奖励,根据认知行为和边际效应对每次工具调用进行分类,实现对搜索轨迹广度、深度和跨度的显式控制。这些改进使得在需要时工具调用能够可靠地扩展至 20 次以上。第二个是 Fathom-Synthesizer-4B,基于 Qwen3-4B 训练,将多轮 DeepSearch 轨迹转化为结构化、高引用密度的 DeepResearch 报告以进行综合。在 DeepSearch 基准和 DeepResearch-Bench 上评估,该系统在开放权重类别中达到 SOTA 性能,同时对 HLE、AIME-25、GPQA-Diamond 和 MedQA 等多种推理任务展现出强泛化能力。
引用
@article{arxiv.2509.24107,
title = {Fathom-DeepResearch: Unlocking Long Horizon Information Retrieval and Synthesis for SLMs},
author = {Shreyas Singh and Kunal Singh and Pradeep Moturi},
journal= {arXiv preprint arXiv:2509.24107},
year = {2025}
}