超越蒸馏:用极简规则型强化学习突破医学LLM推理能力的极限
计算与语言
2025-05-26 v1 人工智能
摘要
提升大型语言模型(LLM)在复杂任务上的性能并实现可解释的决策制定,尤其是在临床应用中,需要有效的推理能力。然而,在不依赖从闭源模型(如GPT-4o)蒸馏的昂贵思维链(CoT)数据进行监督微调(SFT)的情况下,这仍然具有挑战性。在本工作中,我们提出了AlphaMed,第一个展示推理能力可以纯粹通过强化学习(RL)涌现的医学LLM,利用极简的规则型奖励在公开的选择题QA数据集上进行训练,无需依赖SFT或蒸馏的CoT数据。AlphaMed在六个医学QA基准测试上取得了最先进的结果,超越了采用传统SFT+RL流水线训练的模型。在具有挑战性的基准测试(如MedXpert)上,AlphaMed甚至超越了更大或闭源的模型,如DeepSeek-V3-671B和Claude-3.5-Sonnet。为了理解这一成功背后的因素,我们以三个问题为指导进行了全面的以数据为中心的分析:(i)极简规则型RL能否在没有蒸馏CoT监督的情况下激励推理?(ii)数据集的数量和多样性如何影响推理?(iii)问题难度如何塑造推理的涌现和泛化?我们的结果表明数据集的信息性是推理性能的关键驱动因素,在信息丰富的选择题QA数据上进行极简RL可以有效诱导推理而无需CoT监督。我们还在各基准测试中观察到了发散趋势,强调了当前评估的局限性以及对更具挑战性、以推理为导向的医学QA基准测试的需求。
引用
@article{arxiv.2505.17952,
title = {Beyond Distillation: Pushing the Limits of Medical LLM Reasoning with Minimalist Rule-Based RL},
author = {Che Liu and Haozhe Wang and Jiazhen Pan and Zhongwei Wan and Yong Dai and Fangzhen Lin and Wenjia Bai and Daniel Rueckert and Rossella Arcucci},
journal= {arXiv preprint arXiv:2505.17952},
year = {2025}
}
备注
Under Review