用于临床推理的强化学习:使 LLM 对齐 ACR 影像适宜性标准
定量方法
2025-10-08 v1
摘要
医学影像已经彻底改变了诊断,但不必要的检查程序正在增加,使患者暴露于辐射和压力之下,限制了公平获取的机会,并给医疗保健系统带来了压力。美国放射学会适宜性标准通过广泛的多学科审查制定,提供了基于证据的指导,但仍然未被充分利用。利用 LLM 推理方面的进展,我们引入了一个用强化学习(RL)训练的推理智能体,具体为 Group Relative Policy Optimization(GRPO),以复制来自 ACR 标准的专家临床推理。我们提出了一种用于结构化医学推理的新型 RL 方法,系统地比较了侧重推理的奖励函数和证据整合策略。我们的轻量级 8B 模型 MedReason-Embed 将宏观 F1 分数较基线提高了 18%,表现出更强的推理对齐,并优于更大或采用其他方式训练的模型,这表明基于推理的监督能够实现高效、值得信赖的临床 AI。在此基础上,我们设计了一个模块化的端到端智能体架构,使影像转诊自动化:将诊断映射到 ICD 代码,检索 PubMed 证据,并推荐最佳程序。至关重要的是,超越静态 ACR 指南的泛化能力不仅使临床医生能够处理分布外案例,还支持了指南制定过程本身的扩展,从而可能减少创建和更新指南所需的大量工作。这项工作展示了侧重推理的 RL 在智能体架构中提供透明、可扩展且可靠的临床决策支持的潜力。我们的代码可在以下网址获取:https://anonymous.4open.science/r/agentic-imaging-recommender-iclr-877D
引用
@article{arxiv.2510.05194,
title = {Reinforcement Learning for Clinical Reasoning: Aligning LLMs with ACR Imaging Appropriateness Criteria},
author = {Anni Tziakouri and Filippo Menolascina},
journal= {arXiv preprint arXiv:2510.05194},
year = {2025}
}