中文

Baichuan-M2:规模化医疗能力的大型验证系统

机器学习 2025-09-03 v1 人工智能

摘要

随着大型语言模型(LLM)在对话和推理能力方面的进步,其在医疗保健领域的实际应用日益成为研究焦点。然而,传统医学 LLM 在诊断类基准测试(如 USMLE)上的表现,与其在实际临床决策中的实用性之间存在显著差距。这种差距源于传统考试未能捕捉医疗咨询中动态、交互式的特性。为此,我们引入一种新型动态验证框架,超越静态答案验证器,构建大规模、高保真的交互式强化学习系统。该框架包含两个关键组件:用于创建基于去标识化医疗记录的真实临床环境的患者模拟器,以及动态生成多维评估指标的临床评分表生成器。基于此基础,我们开发了 Baichuan-M2,一款参数为 32B 的医疗增强推理模型,通过多阶段强化学习策略训练,采用改进的群体相对政策优化(GRPO)算法。我们在 HealthBench 上对其进行评估,Baichuan-M2 在具有挑战性的 HealthBench Hard 基准测试上取得超越所有开源模型和大多数先进封闭源模型的成绩,得分超过 32 分——此前仅由 GPT-5 超越。我们的工作表明,稳健的动态验证系统是实现 LLM 能力与实际临床应用对齐的关键,为医疗 AI 部署的性能-参数权衡树立了新的 Paretian 前沿。

关键词

引用

@article{arxiv.2509.02208,
  title  = {Baichuan-M2: Scaling Medical Capability with Large Verifier System},
  author = {M2 Team and Chengfeng Dou and Chong Liu and Fan Yang and Fei Li and Jiyuan Jia and Mingyang Chen and Qiang Ju and Shuai Wang and Shunya Dang and Tianpeng Li and Xiangrong Zeng and Yijie Zhou and Chenzheng Zhu and Da Pan and Fei Deng and Guangwei Ai and Guosheng Dong and Hongda Zhang and Jinyang Tai and Jixiang Hong and Kai Lu and Linzhuang Sun and Peidong Guo and Qian Ma and Rihui Xin and Shihui Yang and Shusen Zhang and Yichuan Mo and Zheng Liang and Zhishou Zhang and Hengfu Cui and Zuyi Zhu and Xiaochuan Wang},
  journal= {arXiv preprint arXiv:2509.02208},
  year   = {2025}
}

备注

Baichuan-M2 Technical Report