星系数据集中有多少个数据簇?贝叶斯聚类分析实践
应用统计
2021-08-17 v2
摘要
在基于模型的聚类中,Galaxy 数据集常被用作基准数据集以研究不同建模方法的性能。Aitkin(2001)比较了 Galaxy 数据集的最大似然与贝叶斯分析,并对贝叶斯方法表示保留意见,因为所施加的先验假设相当模糊却在所得结果与结论中起着主要作用。本文旨在通过阐明指定先验如何影响估计簇的数量,来解决 Aitkin 对贝叶斯方法的担忧。我们对有限混合模型的混合(即包含关于分量数的先验的混合模型)的不同先验设定进行敏感性分析。我们在全因子设计中使用了大量不同的先验设定,并评估它们对 Galaxy 数据集估计簇数的影响。结果突出了先验设定的交互效应,并提供了关于推荐哪些先验设定以获得稀疏聚类解的见解。一项使用人工数据的模拟研究提供了进一步的经验证据以支持这些建议。对先验设定影响的清晰理解消除了因选择适当先验的复杂性而阻碍贝叶斯方法使用的限制。此外,先验的正则化性质可被有意利用,以获得满足应用先验期望与需求的合适聚类解。
引用
@article{arxiv.2101.12686,
title = {How many data clusters are in the Galaxy data set? Bayesian cluster analysis in action},
author = {Bettina Grün and Gertraud Malsiner-Walli and Sylvia Frühwirth-Schnatter},
journal= {arXiv preprint arXiv:2101.12686},
year = {2021}
}