利用每日电子健康记录数据进行靶向学习
应用统计
2018-12-18 v2 统计计算
机器学习
摘要
电子健康记录(EHR)数据为在真实世界临床环境中发现的多样化患者群体中开展多时间点干预效果的队列研究,提供了具有成本和时间效益的机会。由于在每日(或更精细)尺度上分析EHR数据的计算成本可能相当高,一种实用的方法是将随访划分为预先指定长度的较粗区间。当前的指南建议采用“较小”的区间,但尚未评估该建议的可行性和实际影响,也未开发出指导这一选择的正式方法。我们利用来自一项糖尿病研究的大规模EHR数据,开始填补这些空白,开发并演示了一种快速且可扩展的靶向学习方法,该方法允许遵循当前建议并研究其对推断的实际影响。更具体地说,我们使用90天、30天、15天和5天的间隔将每日EHR数据映射为四个分析数据集。我们应用半参数和双重稳健的估计方法,即纵向TMLE,来估计每个数据集中四种动态治疗规则的因果效应,并比较所得的推断结果。为了克服这些数据规模带来的计算挑战,我们提出了一种新颖的TMLE实现方法,即“长格式TMLE”,并依赖于可扩展的数据自适应机器学习软件xgboost和h2o的最新进展来估计TMLE的冗余参数。
引用
@article{arxiv.1705.09874,
title = {Targeted Learning with Daily EHR Data},
author = {Oleg Sofrygin and Zheng Zhu and Julie A Schmittdiel and Alyce S. Adams and Richard W. Grant and Mark J. van der Laan and Romain Neugebauer},
journal= {arXiv preprint arXiv:1705.09874},
year = {2018}
}