通过与临床世界模型交互在 LLM 中实现患者动态的智能体化
人工智能
2026-05-15 v1 计算与语言
机器学习
摘要
ICU 中的脓毒症管理需要在快速变化的患者生理状态下做出序贯治疗决策。尽管大语言模型 (LLM) 编码了广泛的临床知识并能对指南进行推理,但它们本质上并不基于以动作为条件的患者动态。我们引入了 SepsisAgent,一个用于脓毒症治疗推荐的世界模型增强 LLM 智能体。SepsisAgent 使用学习到的临床世界模型来模拟患者在候选液体-血管活性药物干预下的反应,并在确定处方之前遵循提出-模拟-优化的工作流程。我们首先表明,仅访问世界模型会产生不一致的 LLM 决策性能,这促使了针对智能体的训练。随后我们通过三阶段课程训练 SepsisAgent:患者动态监督微调、提出-模拟-优化行为克隆,以及基于世界模型的智能体强化学习。在 MIMIC-IV 脓毒症轨迹上,SepsisAgent 在离策略价值方面优于所有传统 RL 和基于 LLM 的基线,同时在指南依从性和不安全动作指标下实现了最佳安全性特征。进一步分析表明,与临床世界模型的重复交互使智能体能够学习患者演化中的规律性,即使在移除模拟器访问权限后这些规律性依然有用。
引用
@article{arxiv.2605.14723,
title = {Agentifying Patient Dynamics within LLMs through Interacting with Clinical World Model},
author = {Minghao Wu and Yuting Yan and Zhenyang Cai and Ke Ji and Chuangsen Fang and Ziying Sheng and Xidong Wang and Rongsheng Wang and Hejia Zhang and Shuang Li and Benyou Wang and Hongyuan Zha},
journal= {arXiv preprint arXiv:2605.14723},
year = {2026}
}