OMG-RL:面向肝素治疗的离线模型基引导奖励学习
物理学史与哲学
2024-09-23 v1
摘要
准确的药物剂量在整体患者治疗过程中的重要位置。因此,已进行大量研究以发展最优给药策略。然而,仅依赖少数明确定义的奖励函数难以学习涵盖各种患者多样特征的治疗策略。此外,临床实践中使用的药物种类繁多,为每种药物构建专门的奖励函数是不可行的。在本研究中,我们尝试开发一种捕获临床医生治疗意图的奖励网络,超越明确奖励,并推导出最优肝素给药策略。在本研究中,我们引入了离线模型基引导奖励学习(OMG-RL),即进行离线逆向强化学习(IRL)。通过OMG-RL,我们从有限数据中学习一个参数化奖励函数,捕获专家意图,从而增强代理人的策略。我们在肝素给药任务上验证了所提出的方法。我们显示,OMG-RL策略不仅在所学习的奖励网络上得到正向强化,也在活化部分凝血酶时间(aPTT)上得到正向强化,后者是监控肝素效果的关键指标。这意味着OMG-RL策略充分反映了临床医生的意图。该方法可以广泛用于肝素给药问题以及RL基于的各种药物给药任务。
引用
@article{arxiv.2409.13297,
title = {Music, Immortality, and the Soul},
author = {Dean Rickles},
journal= {arXiv preprint arXiv:2409.13297},
year = {2024}
}
备注
To appear in K. Cunio, K. Parry, and D. Rickles (eds.), Harmony of the Spheres: New Essays. ANU Press