中文

WiNGPT-3.0 技术报告

计算与语言 2025-06-06 v2

摘要

当前大语言模型(LLMs)存在显著局限性,特别是在结构化、可解释和可验证的医学推理方面,以及在计算资源和数据隐私方面的实际部署挑战。本报告聚焦于 WiNGPT-3.0 的开发,这是一个 320 亿参数 LLM,旨在增强其医学推理能力,并探索其在医疗 IT 基础设施中有效集成的潜力。更广泛的目标是推进临床可用模型。该方法涉及针对通用、医学和临床推理定制的多阶段训练流程。该流程结合了监督微调(SFT)和强化学习(RL),利用了精心策划的长思维链(CoT)数据集、辅助奖励模型和基于证据的诊断链仿真。WiNGPT-3.0 表现出色:特定模型变体在 MedCalc 上取得 66.6 分,在 MedQA-USMLE 上取得 87.1 分。此外,靶向训练将临床推理任务的基准分数从 58.1 提升至 62.5。这些结果表明,即使仅使用几千个样本的有限数据集,强化学习也能提升医学推理准确性。关键的是,这一 RL 在有限数据和计算条件下有效性的展示,为在临床工作流程和医疗信息基础设施中部署更可信、更实用的大语言模型铺平了道路。

关键词

引用

@article{arxiv.2505.17387,
  title  = {WiNGPT-3.0 Technical Report},
  author = {Boqin Zhuang and Chenxiao Song and Huitong Lu and Jiacheng Qiao and Mingqian Liu and Mingxing Yu and Ping Hong and Rui Li and Xiaoxia Song and Xiangjun Xu and Xu Chen and Yaoyao Ma and Yujie Gao},
  journal= {arXiv preprint arXiv:2505.17387},
  year   = {2025}
}