中文

修剪出可靠策略之路:面向重症监护的多目标深度 Q 学习方法

机器学习 2024-10-15 v3 人工智能

摘要

医疗治疗通常涉及一系列决策,每一项都基于先前结果。这一过程与强化学习(RL)高度契合,后者是在未知动态下优化序列决策以最大化累积奖励的框架。尽管 RL 在创建数据驱动的治疗方案方面展现出前景,但其在医疗场景中的应用面临挑战,因为常常需要使用稀疏奖励,主要依据死亡率结果定义。这种稀疏性会降低离线估计的稳定性,成为充分利用 RL 进行医疗决策的重大障碍。我们提出一种深度 Q 学习方法,通过将相关但含噪的频繁测量生物标志物信号整合进奖励设定,在不损害主要结果优化的前提下,获得更可靠的重症监护策略。我们的方法在基于稀疏主要奖励训练最终模型之前,依据所有可用奖励对动作空间进行修剪。该方法在从中间信号提取有价值信息以引导学习的同时,最小化了对主要目标的潜在扭曲。我们在离线与离策略设定下,使用模拟环境和重症监护病房真实健康记录评估了该方法。实证结果表明,我们的方法优于保守 Q 学习和批约束深度 Q 学习等常见离线 RL 方法。通过动作修剪解耦稀疏奖励与频繁测量的奖励代理,我们的工作朝着在数据为王的重症监护环境中开发能有效利用丰富可用信息的可靠策略迈出了一步。

关键词

引用

@article{arxiv.2306.08044,
  title  = {Pruning the Way to Reliable Policies: A Multi-Objective Deep Q-Learning Approach to Critical Care},
  author = {Ali Shirali and Alexander Schubert and Ahmed Alaa},
  journal= {arXiv preprint arXiv:2306.08044},
  year   = {2024}
}

备注

This work has been published in the Journal of Biomedical and Health Informatics. Personal use is permitted, but republication/redistribution requires IEEE permission