BETULA:用于 BIRCH 聚类的数值稳定 CF 树
机器学习
2020-11-30 v1 数据结构与算法
机器学习
摘要
BIRCH 聚类是一种广为人知的聚类方法,影响了大量后续研究与商业产品。BIRCH 的关键贡献是聚类特征树(CF-Tree),它是输入数据的压缩表示。当新数据到达时,树最终会被重建以提高压缩率。之后,树的叶节点被用于聚类。由于数据压缩,该方法具有高度可扩展性。该思想已被采用于例如 k-means、数据流和基于密度的聚类中。BIRCH 使用的聚类特征是可随新数据轻松更新的简单汇总统计量:点数、线性和以及平方和。遗憾的是,BIRCH 中平方和的使用方式容易出现灾难性抵消。我们引入一种替代的聚类特征,它不存在此数值问题,维护代价不高,且使许多计算更简单因而更高效。这些聚类特征也可轻易用于其他源自 BIRCH 的工作,例如流式数据算法。在实验中,我们展示了该数值问题,并比较了原算法与改进聚类特征的性能。
引用
@article{arxiv.2006.12881,
title = {BETULA: Numerically Stable CF-Trees for BIRCH Clustering},
author = {Andreas Lang and Erich Schubert},
journal= {arXiv preprint arXiv:2006.12881},
year = {2020}
}