中文

Gazal-R1:通过参数高效的两阶段训练实现最先进的医学推理

计算与语言 2025-06-30 v1

摘要

我们提出了Gazal-R1,一个320亿参数的语言模型,在医学推理方面实现了最先进的性能,同时为临床决策提供透明、逐步的解释。我们的模型基于Qwen3 32B构建,证明了战略性训练可以使中等规模的模型在专业领域超越显著更大的对手。我们开发了一种新颖的两阶段训练流程:首先,在精心策划的107,033个合成医学推理示例数据集上进行监督微调,该数据集教授结构化的临床思维,并通过先进的参数高效技术(包括权重分解低秩适应和秩稳定LoRA)进行增强;其次,使用组相对策略优化结合复杂的多组件奖励系统进行强化学习,该系统优化了准确性、格式遵循度和推理质量。Gazal-R1在医学基准测试中取得了卓越的性能,在MedQA上得分为87.1%,在MMLU Pro(医学)上得分为81.6%,在PubMedQA上得分为79.6%,超越了规模高达12倍的模型。除了其强大的实证结果外,这项工作还提供了关于在专业领域训练具备推理能力的模型所面临挑战的详细见解,包括奖励破解、训练不稳定以及事实回忆与详细推理之间的基本矛盾等问题。我们的方法为开发高性能、领域特定的语言模型提供了一个可复现的框架,该框架平衡了性能、效率和可解释性。

关键词

引用

@article{arxiv.2506.21594,
  title  = {Gazal-R1: Achieving State-of-the-Art Medical Reasoning with Parameter-Efficient Two-Stage Training},
  author = {Ahmed M. Adly and Mostafa Samy and Amr Fawzy},
  journal= {arXiv preprint arXiv:2506.21594},
  year   = {2025}
}