中文

面向真实世界治疗优化应用的深度离线强化学习

机器学习 2023-06-14 v2

摘要

在许多慢性病管理和重症监护应用中,对推荐最优治疗策略的数据驱动方法兴趣日增。强化学习方法非常契合这一序贯决策问题,但必须仅在回顾性医疗记录数据集上训练和评估,因为直接的在线探索不安全且不可行。尽管有此要求,绝大多数治疗优化研究使用离策略 RL 方法(例如双重深度 Q 网络(DDQN)或其变体),而这些方法在纯离线设定下表现不佳已是已知。离线 RL 的近期进展,如保守 Q 学习(CQL),提供了合适的替代方案。但在将这些方法适配到真实世界应用时仍存在挑战:回顾性数据集中次优样本占主导,且需满足严格安全约束。本工作中,我们引入一种实用且理论有据的转移采样方法,以解决离线 RL 训练中的动作不平衡问题。我们在糖尿病与脓毒症治疗优化两个真实世界任务上进行了大量实验,将所提方法与显著的离策略及离线 RL 基线(DDQN 和 CQL)比较性能。在一系列基于原理且与临床相关的指标上,我们显示所提方法在预期健康结局上实现了实质改善,并符合相关实践与安全指南。

关键词

引用

@article{arxiv.2302.07549,
  title  = {Deep Offline Reinforcement Learning for Real-world Treatment Optimization Applications},
  author = {Milashini Nambiar and Supriyo Ghosh and Priscilla Ong and Yu En Chan and Yong Mong Bee and Pavitra Krishnaswamy},
  journal= {arXiv preprint arXiv:2302.07549},
  year   = {2023}
}