一种针对含协变量与结局数据缺失的大规模医疗数据库研究的可变选择灵活方法
统计方法学
2022-04-14 v2 应用统计
摘要
先前的研究表明,在协变量和结局数据随机缺失(MAR)时,将自助法插补与基于树的机器学习变量选择方法相结合,能够在完全观测数据上取得良好表现。然而,该方法计算代价高昂,尤其在大规模数据集上。我们提出一种基于推断的方法,称为RR-BART,其利用基于似然的贝叶斯机器学习技术——贝叶斯加性回归树(Bayesian additive regression trees),并使用Rubin规则对多重插补数据集上变量重要性度量的估计值与方差进行合并,以在MAR数据存在下进行变量选择。我们开展了一项代表性模拟研究,以考察RR-BART的实际运行特征,并与基于自助法插补的方法进行比较。我们进一步利用来自全国女性健康研究(SWAN)的数据,通过对中年女性代谢综合征3年发病率危险因素的案例分析展示了这些方法。模拟研究表明,即使在非线性和非可加性的复杂条件以及高缺失比例下,RR-BART仍能合理恢复在完全观测数据上可实现的预测与变量选择表现。RR-BART达到了基于自助法插补方法在最优选择阈值下所能取得的最佳性能。此外,RR-BART在检测离散预测因子方面表现出显著更强的能力。并且,RR-BART大幅节省了计算开销。当应用于SWAN数据时,RR-BART筛选出一组以往较少被识别为危险因素但具有充分生物学依据的预测因子,从而丰富了相关文献。
引用
@article{arxiv.2107.09730,
title = {A flexible approach for variable selection in large-scale healthcare database studies with missing covariate and outcome data},
author = {Jung-Yi Joyce Lin and Liangyuan Hu and Chuyue Huang and Steven Lawrence and Usha Govindarajulu},
journal= {arXiv preprint arXiv:2107.09730},
year = {2022}
}
备注
16 pages, 3 figures, 3 tables