中文

深度学习模型在大型调查缺失数据插补中更优吗?基于实证比较的证据

机器学习 2022-03-22 v3 应用统计 机器学习

摘要

多重插补(MI)是处理样本调查中因无应答而产生缺失数据的一种常用方法。链式方程多重插补(MICE)是多元数据中最广泛使用的 MI 算法之一,但它缺乏理论基础且计算密集。近年来,基于深度学习模型的缺失数据插补方法已在小型研究中取得令人鼓舞的结果。然而,与 MICE 相比,关于其在现实环境中性能评估的研究有限,尤其是在大型调查中。我们基于美国社区调查的一个子样本进行了广泛的模拟研究,以比较四种基于机器学习的 MI 方法的重复抽样特性:使用分类树的 MICE、使用随机森林的 MICE、生成对抗插补网络,以及使用去噪自编码器的多重插补。我们发现深度学习插补方法在计算时间上优于 MICE。然而,在常用软件包默认超参数选择下,使用分类树的 MICE 在一系列现实设置中,于偏差、均方误差和覆盖概率方面始终优于(通常大幅优于)深度学习插补方法。

关键词

引用

@article{arxiv.2103.09316,
  title  = {Are deep learning models superior for missing data imputation in large surveys? Evidence from an empirical comparison},
  author = {Zhenhua Wang and Olanrewaju Akande and Jason Poulos and Fan Li},
  journal= {arXiv preprint arXiv:2103.09316},
  year   = {2022}
}