CURE-Med:面向多语言医学推理的课程感知强化学习
人工智能
2026-04-28 v2 计算与语言
摘要
尽管大型语言模型(LLM)在单语数学与常识推理上表现良好,但它们在多语言医学推理应用中仍不可靠,阻碍了其在多语言医疗环境中的部署。我们通过首先引入 CUREMED-BENCH 来解决这一问题,这是一个高质量的多语言医学推理数据集,包含具有单一可验证答案的开放式推理查询,涵盖十三种语言,包括阿姆哈拉语、约鲁巴语和斯瓦希里语等代表性不足的语言。在此数据集的基础上,我们提出了 CURE-MED,一个课程感知强化学习框架,该框架整合了语码转换感知的监督微调与 Group Relative Policy Optimization,以共同提升逻辑正确性与语言稳定性。在十三种语言中,我们的方法持续优于强基线并有效扩展,在 7B 参数下实现了 85.21% 的语言一致性与 54.35% 的逻辑正确性,在 32B 参数下实现了 94.96% 的语言一致性与 70.04% 的逻辑正确性。这些结果支持了 LLM 中可靠且公平的多语言医学推理。代码与数据集可在 https://cure-med.github.io/ 获取。
引用
@article{arxiv.2601.13262,
title = {CURE-Med: Curriculum-Informed Reinforcement Learning for Multilingual Medical Reasoning},
author = {Eric Onyame and Akash Ghosh and Subhadip Baidya and Sriparna Saha and Xiuying Chen and Chirag Agarwal},
journal= {arXiv preprint arXiv:2601.13262},
year = {2026}
}
备注
Accepted at ACL 2026, main conference, oral presentation