高维有无数据的不同聚类方法比较
统计方法学
2021-11-24 v2
摘要
有无数据由零和一组成的向量或矩阵定义,其中一通常表示在某处的“存在”。有无数据出现在例如研究地理物种分布、遗传信息或文本中特定术语出现的情况中。对此类数据进行聚类有许多应用;一个例子是寻找所谓的生物要素,即倾向于在地理上共同出现的物种组。有无数据可以通过多种方式进行聚类,即使用具有局部独立性的潜类混合方法、基于 Jaccard 距离的层次聚类,或也对距离的多维尺度表示使用连续数据聚类方法。这些方法在概念上非常不同,因此不易在理论上进行比较。我们基于物种分布模型通过全面的模拟研究比较了它们的性能。该文已被接受发表于 Ferreira, J., Bekker, A., Arashi, M. and Chen, D. (eds.) Innovations in multivariate statistical modelling: navigating theoretical and multidisciplinary domains, Springer Emerging Topics in Statistics and Biostatistics。
引用
@article{arxiv.2108.09243,
title = {A comparison of different clustering approaches for high-dimensional presence-absence data},
author = {Gabriele d'Angella and Christian Hennig},
journal= {arXiv preprint arXiv:2108.09243},
year = {2021}
}
备注
22 pages, 6 Figures