中文

MedGR$^2$:通过生成式奖励学习打破医学推理数据瓶颈

机器学习 2025-12-09 v2 人工智能

摘要

视觉语言模型 (VLM) 在医疗领域的应用受限于高质量、专家标注数据的稀缺。基于现有数据集进行的监督微调 (SFT) 常导致在未见模态和任务上的泛化性能差异,而强化学习 (RL) 作为一种有前景的替代方案,因缺乏可靠奖励信号而在此数据稀缺领域受阻。为打破这一困境,我们引入面向医学推理的生成式奖励学习 (MedGR2^2),一种 novel 框架,通过 co-develop (联合开发) 数据生成器和奖励模型,实现自动、持续创建高质量、多模态医学数据的自我改进的良性循环。我们的实验表明,使用 MedGR2^2 生成的数据进行 SFT 已超过在大规模人工标注数据集上训练的基线模型。关键在于,利用此数据进行通过组相对策略优化 (GRPO) 的 RL,我们的模型实现了跨模态和跨任务的 state-of-the-art 泛化,显著优于专门的 RL-based 方法。此外,我们的紧凑型模型通过 MedGR2^2 实现的性能与拥有 10 倍以上参数量的 foundation 模型持平。MedGR2^2 为高风险领域的数据高效学习提供了新范式,将问题从数据稀缺转变为数据生成, unlocking 充分发挥 RL 为构建真正通用医学 AI 所潜在的可能性。

关键词

引用

@article{arxiv.2508.20549,
  title  = {MedGR$^2$: Breaking the Data Barrier for Medical Reasoning via Generative Reward Learning},
  author = {Weihai Zhi and Jiayan Guo and Shangyang Li},
  journal= {arXiv preprint arXiv:2508.20549},
  year   = {2025}
}

备注

8 pages, 5 figures