稀疏高维二元数据聚类的有效混合模型
机器学习
2017-07-12 v1 机器学习
摘要
本文提出一种用于稀疏高维二元数据聚类的混合模型 SparseMix,它将基于模型的聚类与基于质心的聚类联系起来。每个组由一个代表点和建模其离散程度的概率分布描述。与基于EM算法的经典混合模型相比,SparseMix:-专为处理稀疏数据而设计,-可通过在线 Hartigan 优化算法高效实现,-能够自动减少不必要的簇。我们在各类数据上进行了广泛的实验研究,证实 SparseMix 构建的划分比相关方法与参考分组具有更高的兼容性。此外,所构建的代表点往往能更好地揭示数据的内部结构。
引用
@article{arxiv.1707.03157,
title = {Efficient mixture model for clustering of sparse high dimensional binary data},
author = {Marek Śmieja and Krzysztof Hajto and Jacek Tabor},
journal= {arXiv preprint arXiv:1707.03157},
year = {2017}
}