MedResearcher-R1:基于知识引导轨迹合成框架的专家级医学深度研究员
计算与语言
2025-09-03 v3
摘要
近期基于大语言模型 (LLM) 的智能体的发展展现了跨越多个领域的卓越能力,以在复杂信息检索与综合任务中表现出优越性能的深度研究系统为代表。尽管通用深度研究智能体展现了令人瞩目的能力,但在应对医学领域的挑战时仍面临巨大困难,正如领先的专有系统在复杂医学基准测试上仅取得有限的准确率所证明的那样。其关键局限在于:(1) 模型缺乏用于临床推理的足够密集医学知识;(2) 框架受限于缺乏为医学场景定制的专用检索工具。我们提出了一种医学深度研究智能体,通过两项核心创新来应对这些挑战。首先,我们开发了一种使用医学知识图谱的新型数据合成框架,从稀有医学实体周围的子图中提取最长链,以生成复杂的多跳问答对。其次,我们将定制的私有医学检索引擎与通用工具相集成,实现准确的医学信息综合。我们的方法在 12 个医学专业领域生成了 2100 多条多样化轨迹,每条轨迹平均包含 4.2 次工具交互。通过结合监督微调和带有复合奖励的在线强化学习的两阶段训练范式,我们的 MedResearcher-R1-32B 模型展现了卓越的性能,在医学基准测试上确立了新的 SOTA 结果,同时在通用深度研究任务上保持竞争力。我们的工作表明,在架构、工具设计和训练数据构建方面的战略性领域特定创新,可以使较小的开源模型在专业领域超越大得多的专有系统。
引用
@article{arxiv.2508.14880,
title = {MedResearcher-R1: Expert-Level Medical Deep Researcher via A Knowledge-Informed Trajectory Synthesis Framework},
author = {Ailing Yu and Lan Yao and Jingnan Liu and Zhe Chen and Jiajun Yin and Yuan Wang and Xinhao Liao and Zhiling Ye and Ji Li and Yun Yue and Hansong Xiao and Hualei Zhou and Chunxiao Guo and Peng Wei and Junwei Liu and Jinjie Gu},
journal= {arXiv preprint arXiv:2508.14880},
year = {2025}
}
备注
13 pages, 5 figures