中文

协变量与结局均缺失下的变量选择:插补与机器学习

统计方法学 2021-07-09 v2 应用统计 机器学习

摘要

缺失数据问题在健康研究中无处不在。在协变量与结局均缺失情况下的变量选择是一个重要的统计研究课题,但研究较少。现有文献聚焦于提供回归模型直接参数估计的参数化回归技术。灵活的非参数机器学习方法大幅降低了对参数假设的依赖,但并未像参数模型固有的协变量效应那样自然地给出变量重要性度量。我们研究了一种一般的变量选择方法,适用于协变量与结局均可随机缺失且具有一般缺失数据模式的情形。该方法利用了机器学习建模技术与自助插补(bootstrap imputation)的灵活性,适用于协变量效应无法直接获得的非参数方法。我们进行了大量模拟,考察所提变量选择方法结合四种基于树的机器学习方法(XGBoost、Random Forests、Bayesian Additive Regression Trees (BART) 和 Conditional Random Forests)以及两种常用参数方法(lasso 与向后逐步选择)时的实际运行特征。数值结果表明,结合自助插补时,XGBoost与BART在各种设定下就 F1F_1 分数与I类错误而言具有总体最佳的变量选择表现。总体而言,插补方法的不同未导致变量选择表现的显著差异。我们进一步通过一项基于Study of Women's Health Across the Nation数据的代谢综合征3年发病风险因素的案例研究演示了这些方法。

关键词

引用

@article{arxiv.2104.02769,
  title  = {Variable selection with missing data in both covariates and outcomes: Imputation and machine learning},
  author = {Liangyuan Hu and Jung-Yi Joyce Lin and Jiayi Ji},
  journal= {arXiv preprint arXiv:2104.02769},
  year   = {2021}
}

备注

29 pages, 17 figures, 4 tables