存在缺失数据时的可解释预测规则集成
应用统计
2024-10-22 v1
摘要
预测规则集成(PREs)是稳健且可解释的统计学习技术,具有预测分析的潜力,但它们在存在缺失数据时的有效性尚未得到测试。本研究使用多重插补来填充缺失值,但使用数据堆叠方法而不是传统的模型池化方法来组合结果。我们进行了一项模拟研究,在现实条件下比较插补方法,重点关注和的样本量,共进行1,000次重复。评估的技术包括使用预测均值匹配的链式方程多重插补(MICE PMM)、使用随机森林的MICE(MICE RF)、使用ranger算法的随机森林插补(missRanger)以及使用极端梯度提升的插补(MIXGBoost),并将结果与列表删除进行比较。由于堆叠多个插补数据集可能会使模型过于复杂,我们还探索了不同的粗化水平,以简化和增强PRE模型的可解释性和性能。我们的发现强调了在选择插补方法时预测性能和模型复杂性之间的权衡。虽然MIXGBoost和MICE PMM产生较高的规则恢复率,但它们也增加了规则选择中的假阳性。相比之下,MICE RF和missRanger促进了规则稀疏性。MIXGBoost实现了最大的MSE降低,其次是MICE PMM、MICE RF和missRanger。避免对变量进行过于粗略的舍入有助于在性能损失很小的情况下减小模型规模。列表删除对模型有效性有不利影响。我们的结果强调了根据研究目标选择合适的插补技术以及推进统计学习中处理缺失数据的方法的重要性。
引用
@article{arxiv.2410.16187,
title = {Interpretable Prediction Rule Ensembles in the Presence of Missing Data},
author = {Vincent Schroeder and Jakob Schwerter and Marjolein Fokkema and Philipp Doebler},
journal= {arXiv preprint arXiv:2410.16187},
year = {2024}
}
备注
*Contributed equally and share the first authorship