中文

一种用于估计最优动态治疗方案的惩罚共享参数算法

机器学习 2024-12-05 v3 机器学习

摘要

动态治疗方案(DTR)是一组利用个体医疗史为其个性化制定治疗的决策规则。基于Q学习的Q-shared算法已被用于开发涉及多个干预阶段共享决策规则的DTR。我们表明,现有的Q-shared算法由于Q学习框架中线性模型的使用可能遭遇不收敛问题,并指出了Q-shared失效的条件。我们提出了一种惩罚Q-shared算法,该算法不仅在违背该条件的设定下能够收敛,而且即使在该条件满足时也能优于原始Q-shared算法。我们在一个真实应用和多个合成仿真中给出了所提方法的证据。

关键词

引用

@article{arxiv.2107.07875,
  title  = {A Penalized Shared-parameter Algorithm for Estimating Optimal Dynamic Treatment Regimens},
  author = {Palash Ghosh and Xinru Wang and Trikay Nalamada and Shruti Agarwal and Maria Jahja and Bibhas Chakraborty},
  journal= {arXiv preprint arXiv:2107.07875},
  year   = {2024}
}