Med-RLVR:通过强化学习从 3B 参数基础模型中涌现医学推理能力
计算与语言
2025-02-28 v1 人工智能
摘要
从可验证奖励的强化学习(RLVR)最近因能够在无需显式推理监督的情况下,从基础语言模型中激发出自我演化的推理能力而引起广泛关注,如 DeepSeek-R1 所示。虽然 RLVR 的 prior 工作主要集中在数学和编码领域,但其适用于其他任务和领域的可能性尚未探讨。本文中,我们调查了医学推理是否可以从 RLVR 中涌现。我们引入 Med-RLVR 作为 RLVR 在医学领域的初始研究,利用医学多选问答(MCQA)数据作为可验证标签。我们的结果表明,RLVR 不仅对数学和编码有效,也成功扩展到医学问答。值得注意的是,Med-RLVR 在分布内任务上表现出与传统监督微调(SFT)相当的表现,同时在分布外推理方面显著提升,准确率提升 8 分。进一步的训练动力学分析揭示了,尽管没有明确的推理监督,推理能力仍从 30 亿参数的基础模型中涌现。这些发现凸显了 RLVR 在数学和编码之外的其他领域的潜力,为其在诸如医学等知识密集型领域的应用开辟了新途径。
引用
@article{arxiv.2502.19655,
title = {Med-RLVR: Emerging Medical Reasoning from a 3B base model via reinforcement Learning},
author = {Sheng Zhang and Qianchu Liu and Guanghui Qin and Tristan Naumann and Hoifung Poon},
journal= {arXiv preprint arXiv:2502.19655},
year = {2025}
}