中文

基于模型的聚类一致性:使用拟伯努利断棍过程

统计方法学 2024-03-05 v4

摘要

在混合模型与聚类应用中,分量与聚类的数量通常未知。断棍混合模型(如狄利克雷过程混合模型)是一种吸引人的构造,它假设有无穷多个分量,同时将大多数未使用分量的权重收缩至接近零。然而,众所周知这种收缩是不充分的:即使分量分布被正确设定,也会出现伪权重,从而对聚类数量给出不一致的估计。在本文中,我们提出一个简单的解决方案:在将每个混合权重棍棒折断为两段时,第二段的长度乘以一个拟伯努利随机变量,该变量取值为1或一个接近零的微小常数。这有效地创建了软截断并进一步收缩未使用的权重。在渐近意义上,我们证明只要该微小常数以快于o(1/n2)o(1/n^2)的速率(其中nn为样本量)趋于零,后验分布就会收敛到真实的聚类数量。作为比较,我们严格探讨了使用常数或快速趋于零的浓度参数的狄利克雷过程混合模型——两者都导致聚类数量估计的不一致。我们提出的模型易于实现,仅需对标准混合模型Gibbs采样器做微小修改。在模拟及脑网络聚类的应用数据中,我们提出的方法恢复了真实的聚类数量,并得出较少的聚类数。

关键词

引用

@article{arxiv.2008.09938,
  title  = {Consistent Model-based Clustering: using the Quasi-Bernoulli Stick-Breaking Process},
  author = {Cheng Zeng and Jeffrey W. Miller and Leo L. Duan},
  journal= {arXiv preprint arXiv:2008.09938},
  year   = {2024}
}

备注

36 pages, 11 figures