ProMed:基于Shapley信息增益引导的医学LLM预发掘强化学习
计算与语言
2025-08-20 v1 人工智能
摘要
交互式医学问诊是实际临床咨询中的关键环节,医生必须主动从患者那里收集信息。虽然医学大型语言模型(LLM)在静态医学问答方面表现出色,但它们主要 operate 在反应式范式下:直接生成答案而不主动寻求额外信息,在此类互动环境中可能导致诊断错误。为此,我们提出ProMed,一种强化学习(RL)框架,使医学LLM向主动范式转变,赋予其在决策前询问临床有价值问题的能力。ProMed的核心是Shapley信息增益(SIG)奖励,其量化每个问题的临床效用,通过结合新获取信息的量与其上下文重要性(通过Shapley值估计)来实现。我们将SIG集成到两个阶段的训练管道中:(1)SIG引导的模型初始化使用蒙特卡洛树搜索(MCTS)构建高奖励交互轨迹以监督模型;(2)SIG增强的策略优化,将SIG整合到RL中,并引入新颖的SIG引导奖励分配机制,为具有信息量更高的问题分配更高奖励,以实现针对性优化。在两个新精选的部分信息医学基准上进行大量实验,表明ProMed在SOTA方法上平均提升6.29%,相较于反应式范式实现54.45%的提升,同时在跨域情况中也能稳健地泛化。
引用
@article{arxiv.2508.13514,
title = {ProMed: Shapley Information Gain Guided Reinforcement Learning for Proactive Medical LLMs},
author = {Hongxin Ding and Baixiang Huang and Yue Fang and Weibin Liao and Xinke Jiang and Zheng Li and Junfeng Zhao and Yasha Wang},
journal= {arXiv preprint arXiv:2508.13514},
year = {2025}
}