在线无替换 k-means 聚类的意外效应
机器学习
2021-02-23 v2 数据结构与算法
机器学习
摘要
离线 k-means 聚类已被广泛研究,且已有常数近似的算法可用。然而,在线聚类仍属未知领域。新的因素开始起作用:数据集的排序,以及点的数量 n 是否预先已知。它们的确切效应尚不清楚。在本文中,我们关注决策不可逆的在线设定:点到达后,算法需决定是否将该点作为中心,且此决定为最终决定。在此设定下,达到常数近似需要多少及多少中心才足够?我们展示了所有不同情形的上下界。这些界除常数因子外完全一致,从而达到了最优界。例如,对于常数 k>1 的 k-means 代价与随机顺序,Theta(log n) 个中心足以实现常数近似,而仅预先获知 n 便可将中心数降至常数。这些界适用于任何满足三角型不等式的距离函数。
引用
@article{arxiv.1908.06818,
title = {Unexpected Effects of Online no-Substitution k-means Clustering},
author = {Michal Moshkovitz},
journal= {arXiv preprint arXiv:1908.06818},
year = {2021}
}