分类数据多重插补方法的实证比较
统计计算
2018-08-30 v2 统计方法学
摘要
多重插补是处理统计数据库中缺失值的常用方法。插补者利用从观测数据估计的预测模型进行抽样以填补缺失值,从而生成数据库的多个完整版本。研究人员开发了各种默认例程来实现多重插补;然而,比较这些方法性能的研究有限,特别是对于分类数据。我们使用模拟研究来比较三种分类数据默认多重插补方法的重复抽样特性,包括使用广义线性模型的链式方程、使用分类和回归树的链式方程,以及基于 Dirichlet 过程混合模型的完全贝叶斯联合分布。我们的模拟基于来自美国社区调查的分类数据。在本研究的情况下,结果表明基于广义线性模型的默认链式方程方法被默认的回归树和贝叶斯混合模型方法所超越。结果还表明,回归树和贝叶斯混合模型方法具有相互竞争的优势,使得两者都成为分类数据多重插补的合理默认引擎。本文的补充材料可在线获取。
引用
@article{arxiv.1508.05918,
title = {An Empirical Comparison of Multiple Imputation Methods for Categorical Data},
author = {Olanrewaju Akande and Fan Li and Jerome Reiter},
journal= {arXiv preprint arXiv:1508.05918},
year = {2018}
}