通过真误差界与族wise Bandits的可扩展 K-Medoids
机器学习
2019-10-31 v2 机器学习
摘要
K-Medoids(KM)是一种标准的聚类方法,广泛用于半度量数据。KM的误差分析传统上使用样本内误差概念,这可能远离真实误差并存在泛化差距。我们基于底层数据分布形式化了真实 K-Medoid 误差。我们将真实误差分解为基本的统计问题:最小估计(ME)和最小均值估计(MME)。我们给出了 MME 的收敛结果。我们表明的下降速度不低于,其中为样本量度量。受此界启发,我们提出一种计算高效、分布式的 KM 算法,即 MCPAM。MCPAM 的期望运行时间为,其中为 medoids 数量,为样本数。MCPAM 以微小的精度折损换取了巨大的计算节省。我们在多个数据集上验证了 MCPAM 的质量与可扩展特性,并实现了此前未达的壮举:在半度量空间上对 10 亿个点计算 KM。
引用
@article{arxiv.1905.10979,
title = {Scalable K-Medoids via True Error Bound and Familywise Bandits},
author = {Aravindakshan Babu and Saurabh Agarwal and Sudarshan Babu and Hariharan Chandrasekaran},
journal= {arXiv preprint arXiv:1905.10979},
year = {2019}
}