中文

具有策略适应的去混杂 actor-critic 网络用于动态治疗策略

机器学习 2022-06-01 v2 人工智能

摘要

尽管在基础与临床研究上付出了巨大努力,针对危重患者的个体化通气策略仍是一项重大挑战。近来,基于电子健康记录(EHR)并利用强化学习(RL)的动态治疗策略(DTR)引起了医疗行业与机器学习研究团体的兴趣。然而,由于混杂因素的存在,大多数已学习的 DTR 策略可能存在偏倚。尽管非存活者接受的某些治疗动作可能是有益的,但如果混杂因素导致了死亡,以长期结局(如 90 天死亡率)为指导的 RL 模型训练会惩罚那些治疗动作,致使学到的 DTR 策略次优。在本研究中,我们提出一种新的去混杂 actor-critic 网络(DAC)来学习患者的最优 DTR 策略。为缓解混杂问题,我们将患者重采样模块与混杂平衡模块纳入 actor-critic 框架。为避免惩罚非存活者接受的有效治疗动作,我们设计了一种短期奖励以捕捉患者即时的健康状态变化。结合短期与长期奖励可进一步提升模型性能。此外,我们引入一种策略适应方法,将学到的模型成功迁移至新来源的小规模数据集。在 one 半合成与两个不同真实世界数据集上的实验结果表明,所提模型优于最先进的模型。该模型为机械通气提供了个体化治疗决策,可改善患者结局。

关键词

引用

@article{arxiv.2205.09852,
  title  = {Deconfounding Actor-Critic Network with Policy Adaptation for Dynamic Treatment Regimes},
  author = {Changchang Yin and Ruoqi Liu and Jeffrey Caterino and Ping Zhang},
  journal= {arXiv preprint arXiv:2205.09852},
  year   = {2022}
}