中文

ReasonMed: 一个由多智能体生成的 370K 数据集,用于推进医学推理

计算与语言 2025-10-10 v3 人工智能 多智能体系统

摘要

基于推理的大语言模型在数学和编程领域表现出色,但其在知识密集型医学问答中的潜力在临床语境中仍未得到充分探索和验证。为弥补这一空白,我们引入 ReasonMed,这是迄今为止最大的医学推理数据集,包含 370k 个高质量示例,这些示例源自 175 万条初始推理路径,由互补的大语言模型生成,并通过一种高效的简单-中等-困难(EMD)流程进行筛选。ReasonMed 通过多智能体生成、验证与优化流程构建,其中错误优化器通过验证器识别的易错步骤来改进推理路径。利用 ReasonMed,我们研究了训练医学推理模型的有效策略,发现将详细的思维链推理与简洁的答案摘要相结合,能够产生最稳健的微调结果。在 ReasonMed 上训练的模型设立了新的基准:ReasonMed-7B 超越了此前最佳的亚 10B 模型 4.17%,甚至在 PubMedQA 上超越了 LLaMA3.1-70B 4.60%。当扩展至 ReasonMed-14B 时,它仍然具有很强的竞争力,凸显了一致的扩展潜力。代码和数据集可在 https://github.com/YuSun-Work/ReasonMed 获取。

关键词

引用

@article{arxiv.2506.09513,
  title  = {ReasonMed: A 370K Multi-Agent Generated Dataset for Advancing Medical Reasoning},
  author = {Yu Sun and Xingyu Qian and Weiwen Xu and Hao Zhang and Chenghao Xiao and Long Li and Deli Zhao and Wenbing Huang and Tingyang Xu and Qifeng Bai and Yu Rong},
  journal= {arXiv preprint arXiv:2506.09513},
  year   = {2025}
}

备注

28 pages, 6 figures, 7 tables