强化学习用于精准给药的挑战:作用效应的延迟与持久性
机器学习
2023-01-03 v1
摘要
给药是人工智能的一项重要应用,可形式化为强化学习(RL)问题。本文中,我们指出了使用RL进行给药的两个主要挑战:给药的延迟与持久效应,它们破坏了RL框架的马尔可夫假设。我们聚焦于持久性,并定义了PAE-POMDP(持久动作效应-部分可观测马尔可夫决策过程),这是POMDP的一类子类,其中马尔可夫假设因动作的持久效应而不成立。受药理学文献启发,我们提出了一种简单有效的方法,将给药PAE-POMDP转化为MDP,从而能够使用现有RL算法求解此类问题。我们在一个玩具任务和一个具有挑战性的血糖控制任务上验证了所提方法,并为后者设计了一个受临床启发的奖励函数。我们的结果表明:(1) 所提恢复马尔可夫假设的方法相比朴素基线有显著提升;(2) 该方法与可能固有捕捉动作持久效应的循环策略具有竞争力;(3) 它比循环基线在时间和内存上高效得多,因此更适用于实时给药控制系统;(4) 在我们的策略分析中展现出良好的定性行为。
引用
@article{arxiv.2301.00512,
title = {On the Challenges of using Reinforcement Learning in Precision Drug Dosing: Delay and Prolongedness of Action Effects},
author = {Sumana Basu and Marc-André Legault and Adriana Romero-Soriano and Doina Precup},
journal= {arXiv preprint arXiv:2301.00512},
year = {2023}
}
备注
Accepted to AAAI 2023