关于强化学习镇静和止痛的更安全方法
机器学习
2026-05-19 v2 人工智能
摘要
重症室的疼痛管理通常涉及复杂的权衡,因为不充分或过度的治疗都可能危及患者安全。先前的镇痛和镇静强化学习研究探索了如何优化这些干预措施,但未考虑患者生存率或部分可观测性。为调查这些设计选择的风险,我们开发了一个离线深度强化学习框架,根据循环状态表示建议每小时的药物剂量。我们使用来自47,144例ICU住院记录的数据,对行为正则化演员-批评家模型进行训练和评估,这些模型根据两个目标建议连续剂量的阿片类、丙泊酚、苯二氢䇁盐和 dexmedetomidine:降低疼痛或联合降低疼痛和30天出院后死亡率。尽管两个 resulting policies都与降低疼痛相关,但与疼痛唯一政策的临床一致性与死亡率呈正相关(ρ=0.119,p<0.0001),而与联合政策一致性则为负相关(ρ=-0.316,p<0.0001)。我们发现,这种差异源于对高水平合并症的不同反应。这表明,即使短期目标保持为首要目标,重视出院后结果也可能是学习更安全治疗政策的关键。
引用
@article{arxiv.2601.23154,
title = {On Safer Reinforcement Learning for Sedation and Analgesia in Intensive Care},
author = {Joel Romero-Hernandez and Oscar Camara},
journal= {arXiv preprint arXiv:2601.23154},
year = {2026}
}
备注
48th Annual International Conference of the IEEE Engineering in Medicine & Biology Society (EMBC 2026)