利用课程感知强化学习改进医学推理
人工智能
2025-05-27 v1
摘要
最近在具有可验证、基于规则的奖励的强化学习方面的进展,极大地增强了 VLM/LLM 的推理能力和分布外泛化能力,从而无需手动构建推理链。尽管在通用领域取得了这些有希望的发展,但它们向医学图像领域的转化仍然有限。当前的医学强化微调(RFT)方法主要集中于封闭式 VQA,从而限制了模型进行世界知识检索和灵活任务适应的能力。更关键的是,这些方法未能满足对开放式、推理密集型决策的关键临床需求。为了弥合这一差距,我们引入了 \textbf{MedCCO},这是第一个为医学 VQA 量身定制的多模态强化学习框架,它在课程驱动的 RFT 范式内统一了封闭式和开放式数据。具体而言,MedCCO 首先在多样化的封闭式医学 VQA 任务上进行微调以建立领域基础推理能力,然后逐步适应开放式任务以促进更深层次的知识增强和临床可解释性。我们在跨越封闭式和开放式设置的八个具有挑战性的医学 VQA 基准上验证了 MedCCO。实验结果表明,MedCCO 持续提升了性能和泛化能力,在三个域内任务上实现了 11.4\% 的准确率提升,在五个域外基准上实现了 5.7\% 的改进。这些发现突显了课程引导的 RL 在推进医学多模态语言模型中稳健的、临床相关推理方面的潜力。
引用
@article{arxiv.2505.19213,
title = {Improving Medical Reasoning with Curriculum-Aware Reinforcement Learning},
author = {Shaohao Rui and Kaitao Chen and Weijie Ma and Xiaosong Wang},
journal= {arXiv preprint arXiv:2505.19213},
year = {2025}
}