通过pT-Learning估计最优无限期动态治疗策略
统计方法学
2022-10-19 v2 机器学习
摘要
移动健康(mHealth)技术的近期进展为监测个体健康状态并提供即时个性化干预提供了有效途径。然而,mHealth技术的实际应用对现有学习最优动态治疗策略的方法提出了独特挑战。许多mHealth应用涉及在无限时间范围设定下、具有大量干预选项且决策阶段数发散至无穷的决策问题。此外,临时性药物短缺可能导致最优治疗不可用,而尚不清楚可采用何种替代方案。为应对这些挑战,我们提出近端时间一致性学习(Proximal Temporal consistency Learning, pT-Learning)框架,以估计在确定性稀疏策略模型与随机稀疏策略模型间自适应调整的最优策略。所得极小极大估计量避免了现有算法中的双重采样问题。它可进一步简化,并能轻松纳入离策略数据而无需失配分布校正。我们研究了稀疏策略的理论性质,并建立了关于超额风险与性能误差的有限样本界。所提方法提供于我们的proximalDTR包中,并通过大量模拟研究及OhioT1DM mHealth数据集进行评估。
引用
@article{arxiv.2110.10719,
title = {Estimating Optimal Infinite Horizon Dynamic Treatment Regimes via pT-Learning},
author = {Wenzhuo Zhou and Ruoqing Zhu and Annie Qu},
journal= {arXiv preprint arXiv:2110.10719},
year = {2022}
}