中文

强化学习驱动的数字孪生自适应临床决策支持:基于治疗效应优化奖励的策略

人工智能 2025-08-26 v1

摘要

临床决策支持必须在安全约束下进行在线自适应。我们提出一种在线自适应工具,其中强化学习提供策略,患者数字孪生提供环境,治疗效应定义奖励。该系统从回顾性数据初始化批次受限策略,然后运行流式循环,选择动作、检查安全性,仅在不确定性较高时查询专家。不确定性来源于通过动作价值系数变异构成的紧凑型集成五个Q网络,采用 tanh\tanh 压缩。数字孪生采用有界残差规则更新患者状态。结局模型估计即时临床效果,奖励为相对于具有固定z-score归一化的保守参考标准的治疗效应。线上更新针对最新数据,采用短运行和指数移动平均。在任何动作应用前,基于规则的安全门会强制执行生命体征范围和禁忌症。在合成临床模拟器中的实验显示,系统具有低延迟、稳定吞吐量、固定安全下的低专家查询率,以及相对于标准基于价值的基线的改进回报。该设计将离线策略转化为具有明确控制和快速适应性的持续、临床医生监督下的系统。

关键词

引用

@article{arxiv.2508.17212,
  title  = {Reinforcement Learning enhanced Online Adaptive Clinical Decision Support via Digital Twin powered Policy and Treatment Effect optimized Reward},
  author = {Xinyu Qin and Ruiheng Yu and Lu Wang},
  journal= {arXiv preprint arXiv:2508.17212},
  year   = {2025}
}