动态治疗方案的惩罚Q学习
统计方法学
2011-08-29 v1
摘要
动态治疗方案有效地整合了来自专门设计的临床试验的累积信息和治疗的长期效果。随着这些方案与临床研究纵向数据结合变得越来越流行,开发用于最优动态治疗方案的统计推断是一个高度优先事项。由于治疗效果参数中的非正则性带来的困难,这极具挑战性。在本文中,我们提出了一种新的强化学习框架,称为惩罚Q学习(PQ-learning),在该框架下可以解决非正则性问题并建立有效的统计推断。我们还提出了一种新的统计程序——个体选择——以及将个体选择纳入PQ-learning的相应方法。我们进行了广泛的数值研究,在各种非正则场景下将所提出的方法与现有方法进行比较,并证明所提出的方法在推断和计算方面均具有优越性。所提出的方法通过一项抑郁症临床试验研究的数据进行了演示。
引用
@article{arxiv.1108.5338,
title = {Penalized Q-Learning for Dynamic Treatment Regimes},
author = {Rui Song and Weiwei Wang and Donglin Zeng and Michael R. Kosorok},
journal= {arXiv preprint arXiv:1108.5338},
year = {2011}
}