基于守护正则化的安全离线强化学习:用于机械循环设备的智能脱机
机器学习
2025-11-11 v1
摘要
我们研究了用于机械循环支持(MCS)设备在心源性休克患者中的自动脱机的序列决策问题。MCS设备是一种经皮微轴流泵,提供左心室卸载和前向血液循环,但当前的脱机策略在不同护理团队之间差异很大,且缺乏数据驱动的方法。离线强化学习(RL)在序列决策任务中取得了成功,但我们的应用场景对传统离线RL方法的训练和评估提出了挑战:禁止进行线上患者互动、因合并用治疗而导致循环动力学高度不确定、数据获取有限。我们开发了一个端到端的机器学习框架,其中包含两个关键贡献:①临床意识的 OOD 正则化基于模型的策略优化(CORMPO),一种用于外分布性抑制的密度正则化离线RL算法,同时纳入临床激励函数的塑造;②基于Transformer的概率性数字孪生体,用于策略评估,包含丰富的生理和临床指标。我们证明了\textsf{CORMPO}在轻度假设下可获得理论性能保证。CORMPO在真实和合成数据集上分别比离线RL基线提高了28%的奖励值和82.6%的临床指标得分。我们的ethods提供了一个原则性的框架,用于在需要域专家知识和安全约束的高风险医疗应用中进行安全的离线策略学习。
引用
@article{arxiv.2511.06111,
title = {Guardian-regularized Safe Offline Reinforcement Learning for Smart Weaning of Mechanical Circulatory Devices},
author = {Aysin Tumay and Sophia Sun and Sonia Fereidooni and Aaron Dumas and Elise Jortberg and Rose Yu},
journal= {arXiv preprint arXiv:2511.06111},
year = {2025}
}