中文

时间序列中临床协变量的插补

机器学习 2018-12-04 v1 机器学习

摘要

缺失数据是现实场景中的常见问题,在医疗健康应用中尤为突出,研究者使用电子健康记录(EHR)和观察性研究结果来应用分析方法。对于纵向数据集,该问题更加显著,其中同一主体的多个实例对应不同时间的观测。标准插补方法未考虑多元面板数据中包含的患者特定信息。我们提出新颖插补算法 MedImpute 解决该问题,扩展了 Bertsimas 等人(2018)提出的 OptImpute 灵活框架。我们的算法对含缺失连续与分类特征的数据集提供插补,并给出 K-NN 模型的公式表述及可扩展一阶方法的实现。我们在 Framingham 心脏研究的纵向数据上测试算法性能,数据缺失完全随机(MCAR)。我们证明相比最先进方法,MedImpute 在插补精度与下游模型 AUC 上均有显著提升。

关键词

引用

@article{arxiv.1812.00418,
  title  = {Imputation of Clinical Covariates in Time Series},
  author = {Dimitris Bertsimas and Agni Orfanoudaki and Colin Pawlowski},
  journal= {arXiv preprint arXiv:1812.00418},
  year   = {2018}
}

备注

Machine Learning for Health (ML4H) Workshop at NeurIPS 2018 arXiv:1811.07216