微聚类:当簇大小随数据集大小次线性增长时
统计方法学
2015-12-03 v1 应用统计
统计计算
机器学习
摘要
大多数用于聚类的生成模型隐式地假设每个簇中的数据点数量与数据点总数呈线性增长。有限混合模型、狄利克雷过程混合模型和Pitman–Yor过程混合模型都做此假设,所有其他无穷可交换聚类模型亦然。然而,对于某些任务,该假设是不可取的。例如,在执行实体解析时,每个簇的大小通常与数据集大小无关。因此,每个簇包含总数据点中可忽略的分数。此类任务因此需要产生簇大小随数据集大小次线性增长的模型。我们通过定义\emph{微聚类性质}并引入展现该性质的新模型来满足这一需求。我们通过使用真实和模拟数据集检查模型拟合,将该模型与几种常用聚类模型进行比较。
引用
@article{arxiv.1512.00792,
title = {Microclustering: When the Cluster Sizes Grow Sublinearly with the Size of the Data Set},
author = {Jeffrey Miller and Brenda Betancourt and Abbas Zaidi and Hanna Wallach and Rebecca C. Steorts},
journal= {arXiv preprint arXiv:1512.00792},
year = {2015}
}
备注
8 pages, 3 figures, NIPS Bayesian Nonparametrics: The Next Generation Workshop Series