MediX-R1:面向医学多模态大语言模型的开放式医学强化学习
计算机视觉与模式识别
2026-02-27 v1
摘要
我们介绍MediX-R1,这是一个面向医学多模态大语言模型(MLLM)的开放式强化学习(RL)框架,使其能够获得临床导向的自由形式答案,而不仅仅是多选格式。MediX-R1通过基于群体的RL和针对医学推理设计的复合奖励来微调基础视觉语言 Backbone。该奖励包括:基于LLM的准确性奖励,通过严格的YES/NO决定判断语义正确性;医学嵌入式语义奖励,用于捕捉同义词和术语变体;以及轻量级格式和模态奖励,用于强制可解释推理和模态识别。这种多信号设计为开放式输出提供了稳定、信息丰富的反馈,而传统的可验证或仅限MCQ奖励在此类输出中不足。为衡量进展,我们提出了统一的评估框架,用于文本-only和图像+文本任务,采用基于参考的LLM评判器代替脆弱的字符串重叠指标,捕捉语义正确性、推理和情境对齐。尽管仅使用约5.1万条指令示例,MediX-R1在标准医学LLM(文本-only)和VLM(图像+文本)基准测试中均取得优异成绩,尤其在开放式临床任务上取得了显著提升。我们的结果表明,综合奖励信号和LLM-based评估的开放式RL是实现可靠医学推理的实用路径。我们训练的模型、精选数据集和源代码均已在 https://medix.cvmbzuai.com 提供。
引用
@article{arxiv.2602.23363,
title = {MediX-R1: Open Ended Medical Reinforcement Learning},
author = {Sahal Shaji Mullappilly and Mohammed Irfan Kurpath and Omair Mohamed and Mohamed Zidan and Fahad Khan and Salman Khan and Rao Anwer and Hisham Cholakkal},
journal= {arXiv preprint arXiv:2602.23363},
year = {2026}
}