中文

含缺失数据的聚类:何种插补模型适配何种聚类分析方法?

统计方法学 2021-06-09 v1

摘要

多重插补(MI)是处理缺失值的常用方法。MI 的一大优势是将插补阶段与分析阶段分离。然而二者相互关联,因其所基于的分布假设须保持一致。这一点即所谓相容性(congeniality)。本文讨论连续数据聚类的相容性。首先,我们从理论上阐明两种联合建模(JM)MI 方法(JM-GL 与 JM-DP)如何与多种聚类方法相容。接着,我们提出一种具有与 JM-GL 相同理论性质的新型完全条件规范(FCS)MI 方法。最后,我们将该 FCS MI 方法推广至更复杂的分布。基于广泛的模拟研究,我们比较了所有 MI 方法在各种聚类分析方法(k-means、k-medoids、混合模型、层次聚类)下的表现。该研究表明,当插补模型考虑聚类的个体时,划分准确度得以提升。据此,应避免忽略此类结构的标准 MI 方法。当数据依高斯混合模型分布时,推荐 JM-GL 与 JM-DP;而在更复杂数据上,FCS 方法优于 JM 方法。

关键词

引用

@article{arxiv.2106.04424,
  title  = {Clustering with missing data: which imputation model for which cluster analysis method?},
  author = {Vincent Audigier and Ndèye Niang and Matthieu Resche-Rigon},
  journal= {arXiv preprint arXiv:2106.04424},
  year   = {2021}
}