面向医疗健康的半马尔可夫离线强化学习
机器学习
2022-03-22 v2
摘要
强化学习(RL)任务通常被框定为马尔可夫决策过程(MDPs),假设决策在固定时间间隔做出。然而,许多极其重要的应用(包括医疗健康)不满足该假设,却常在人为重塑数据后被建模为MDPs。此外,大多数医疗健康(及类似)问题本质上是离线的,仅允许回顾性研究。为应对这两大挑战,我们首先讨论半马尔可夫决策过程(SMDP)框架,其正式处理变时长动作。接着我们给出将SMDP修正应用于几乎任意给定基于值的离线RL方法的正式方式。利用该理论,我们引入三种基于SMDP的离线RL算法,即SDQN、SDDQN和SBCQ。随后我们通过实验证明,仅有这些基于SMDP的算法在变时间环境中学习到最优策略,而其MDP对应算法则不能。最后,我们将新算法应用于关于预防中风的华法林给药的真实离线数据集,并展示了类似结果。
引用
@article{arxiv.2203.09365,
title = {Semi-Markov Offline Reinforcement Learning for Healthcare},
author = {Mehdi Fatemi and Mary Wu and Jeremy Petch and Walter Nelson and Stuart J. Connolly and Alexander Benz and Anthony Carnicelli and Marzyeh Ghassemi},
journal= {arXiv preprint arXiv:2203.09365},
year = {2022}
}
备注
Published at Conference on Health, Inference, and Learning (CHIL) 2022