中文

利用多层级奇异值分解填补混合数据

应用统计 2018-05-01 v1

摘要

对大型数据集的统计分析为更好地理解许多过程提供了新机遇。然而,数据积累通常意味着放宽采集流程或合并不同来源的数据。因此,此类数据集通常包含混合数据,即同时具有定量和定性数据以及大量缺失值。此外,聚合数据呈现出自然的“多层级”结构,其中个体或样本嵌套在不同的点中,例如国家或医院。因此,多层级数据的填补近期引起了关注,但现有的解决方案并非为处理混合数据而设计,且存在计算成本高等重大缺陷。在本文中,我们提出了一种多层级数据的单次填补方法,可用于补全定量、分类或混合数据。该方法基于多层级奇异值分解 (SVD),其将数据的变异性分解为两个部分:组间变异性和组内变异性,并对这两部分分别进行 SVD。我们在模拟研究中表明,与竞争方法相比,该方法具有处理各种规模数据集的巨大优势,且计算速度更快。此外,它是迄今为止首个能够处理混合数据的方法。我们将该方法应用于填补一个由来自不同医院的多个数据集聚合而成的医疗数据集。该应用属于一个更大的创伤患者项目框架。为了克服医疗数据聚合相关的障碍,我们采用了分布式计算。该方法已在 R 包中实现。

关键词

引用

@article{arxiv.1804.11087,
  title  = {Imputation of mixed data with multilevel singular value decomposition},
  author = {François Husson and Julie Josse and Balasubramanian Narasimhan and Geneviève Robin},
  journal= {arXiv preprint arXiv:1804.11087},
  year   = {2018}
}