中文

高维有无数据的不同聚类方法比较

统计方法学 2021-11-24 v2

摘要

有无数据由零和一组成的向量或矩阵定义,其中一通常表示在某处的“存在”。有无数据出现在例如研究地理物种分布、遗传信息或文本中特定术语出现的情况中。对此类数据进行聚类有许多应用;一个例子是寻找所谓的生物要素,即倾向于在地理上共同出现的物种组。有无数据可以通过多种方式进行聚类,即使用具有局部独立性的潜类混合方法、基于 Jaccard 距离的层次聚类,或也对距离的多维尺度表示使用连续数据聚类方法。这些方法在概念上非常不同,因此不易在理论上进行比较。我们基于物种分布模型通过全面的模拟研究比较了它们的性能。该文已被接受发表于 Ferreira, J., Bekker, A., Arashi, M. and Chen, D. (eds.) Innovations in multivariate statistical modelling: navigating theoretical and multidisciplinary domains, Springer Emerging Topics in Statistics and Biostatistics。

关键词

引用

@article{arxiv.2108.09243,
  title  = {A comparison of different clustering approaches for high-dimensional presence-absence data},
  author = {Gabriele d'Angella and Christian Hennig},
  journal= {arXiv preprint arXiv:2108.09243},
  year   = {2021}
}

备注

22 pages, 6 Figures