中文

DEEPMED:基于多跳医学搜索数据与轮次控制的智能体训练及推理构建医学深度研究智能体

人工智能 2026-02-05 v2

摘要

医学推理模型受限于参数化知识,因此容易发生遗忘和幻觉。DeepResearch (DR) 模型将输出建立在来自工具的可验证证据之上,并在通用领域表现优异,但将其直接迁移到医学领域获得的收益相对有限。我们将此归因于两个差距:任务特征和工具使用规模。医学问题需要在知识密集型的临床背景下进行证据解释;而通用 DR 模型虽然能够检索信息,但往往缺乏临床上下文推理能力,从而“找到了却无法使用”,导致性能受限于医学能力。此外,在医学场景中,盲目扩大工具调用规模会注入噪声上下文,干扰敏感的医学推理,并促使模型沿错误路径重复寻找证据。因此,我们提出 DeepMed。在数据方面,我们部署了一种多跳医学搜索问答合成方法,支持模型在医学上下文中应用 DR 范式。在训练方面,我们引入了难度感知的轮次惩罚,以抑制工具调用的过度增长。在推理方面,我们引入了一个监视器,以帮助在受控的步骤数内验证假设并避免上下文腐化。总体而言,在七个医学基准上,DeepMed 平均使其基础模型提升了 9.79%,并优于更大的医学推理模型和 DR 模型。

关键词

引用

@article{arxiv.2601.18496,
  title  = {DEEPMED: Building a Medical DeepResearch Agent via Multi-hop Med-Search Data and Turn-Controlled Agentic Training & Inference},
  author = {Zihan Wang and Hao Wang and Shi Feng and Xiaocui Yang and Daling Wang and Yiqun Zhang and Jinghao Lin and Haihua Yang and Xiaozhong Ji},
  journal= {arXiv preprint arXiv:2601.18496},
  year   = {2026}
}