基于观测数据的最优动态治疗制度策略学习
统计方法学
2025-05-21 v7 计量经济学
统计理论
机器学习
统计理论
摘要
公共政策和医疗干预通常涉及动态治疗分配,其中个体在多个阶段接受一系列干预。我们研究最优动态治疗制度(DTR)的统计学习,该制度根据个体不断更新的历史确定每个阶段的最优治疗分配。我们提出了一种新颖的、双重稳健的、基于分类的方法,在序贯可忽略性假设下从观测数据学习最优DTR。该方法通过反向归纳进行:在每个阶段,它构建并最大化策略价值函数的增广逆概率加权(AIPW)估计量,以学习最优的阶段特定策略。我们证明,在关于干扰项估计量的温和收敛条件下,所得DTR在福利遗憾方面达到最优收敛速率n^{-1/2}。
引用
@article{arxiv.2404.00221,
title = {Policy Learning for Optimal Dynamic Treatment Regimes with Observational Data},
author = {Shosei Sakaguchi},
journal= {arXiv preprint arXiv:2404.00221},
year = {2025}
}