缺失数据迭代插补的并行计算策略影响:以missForest为例的研究
应用统计
2020-04-24 v1 机器学习
摘要
机器学习迭代插补方法已被研究者广泛接受用于缺失数据插补,但在处理大型数据集时可能非常耗时。为克服这一缺陷,已有并行计算策略被提出,但它们对插补结果及后续统计分析的影响相对未知。本研究考察了随机森林插补方法missForest中实现的两种并行策略(变量分布式计算与模型分布式计算)。模拟实验结果表明,这两种并行策略对插补过程及最终插补结果的影响各不相同。具体而言,尽管两种策略产生了相似的归一化均方根预测误差,但变量分布式策略在估计协变量的均值与互相关及其回归系数时引入了额外偏差。
引用
@article{arxiv.2004.11195,
title = {Influence of parallel computing strategies of iterative imputation of missing data: a case study on missForest},
author = {Shangzhi Hong and Yuqi Sun and Hanying Li and Henry S. Lynn},
journal= {arXiv preprint arXiv:2004.11195},
year = {2020}
}
备注
13 pages, 6 figures