中文

通过强化学习训练 LLM 执行基于 EHR 的推理任务

计算与语言 2025-06-02 v1

摘要

我们提出了 EHRMIND,一种使用可验证奖励的强化学习(RLVR)将大语言模型(LLMs)适配到复杂临床推理任务的实用方案。尽管 RLVR 在数学和编程领域取得了成功,但由于电子健康记录(EHR)解释所需的专业知识和推理能力,其在医疗保健环境中的应用面临独特挑战。我们在 MEDCALC 基准上的试点研究揭示了两种关键的失败模式:(1)知识误用,即模型拥有相关的医学知识但应用不正确;(2)知识缺失,即模型缺乏必要的领域知识。为了解决这些情况,EHRMIND 采用了两阶段解决方案:首先是轻量级监督微调(SFT)热身,注入缺失的领域知识,稳定后续训练,并鼓励结构化、可解释的输出;随后是 RLVR,强化结果的正确性并改进模型的决策。我们在多种临床应用中证明了我们方法的有效性,包括医学计算(MEDCALC)、患者-试验匹配(TREC CLINICAL TRIALS)和疾病诊断(EHRSHOT)。EHRMIND 在准确性、可解释性和跨任务泛化方面提供了一致的提升。这些发现为应用 RLVR 增强 LLM 在医疗保健环境中的能力提供了实用指导。

关键词

引用

@article{arxiv.2505.24105,
  title  = {Training LLMs for EHR-Based Reasoning Tasks via Reinforcement Learning},
  author = {Jiacheng Lin and Zhenbang Wu and Jimeng Sun},
  journal= {arXiv preprint arXiv:2505.24105},
  year   = {2025}
}