中文

使用超级学习和高维倾向评分方法对电子医疗数据库进行倾向评分预测

应用统计 2017-03-16 v2 机器学习

摘要

预测建模的最优学习器取决于底层的数据生成分布。超级学习器(SL)是一种通用的集成学习算法,它利用交叉验证在候选预测模型的“库”中进行选择。SL 不局限于单一预测模型,而是利用多种学习算法的优势来适应不同的数据库。尽管 SL 已在多种情境下表现出色,但尚未在药物流行病学和比较效果研究中常见的大型电子医疗数据库中得到充分评估。在本研究中,我们应用并评估了 SL 在使用三个电子医疗数据库预测治疗分配方面的性能。我们考虑的算法库包含非参数模型和参数模型。我们还考虑了一种将 SL 与高维倾向评分(hdPS)变量选择算法相结合的新型预测建模策略。预测性能使用三个指标进行评估:负对数似然、曲线下面积(AUC)和时间复杂度。结果表明,就预测性能而言,最佳的单算法因数据集而异。SL 能够适应给定的数据集,并相对于任何单一学习器优化预测性能。将 SL 与 hdPS 相结合是最一致的预测方法,对于电子医疗数据库中的 PS 估计和预测建模可能很有前景。

关键词

引用

@article{arxiv.1703.02236,
  title  = {Propensity score prediction for electronic healthcare databases using Super Learner and High-dimensional Propensity Score Methods},
  author = {Cheng Ju and Mary Combs and Samuel D Lendle and Jessica M Franklin and Richard Wyss and Sebastian Schneeweiss and Mark J. van der Laan},
  journal= {arXiv preprint arXiv:1703.02236},
  year   = {2017}
}