中文

具前瞻性的局部搜索 k-means++

数据结构与算法 2024-06-06 v1

摘要

自1957年提出Lloyd算法进行k-means聚类以来,这一方法已被广泛研究并经历了多次改进。虽然原始形式无法保证任何近似因子,但Arthur和Vassilvitskii(SODA 2007)提出的k-means++通过引入初始化方法,保证了在期望意义下达到 O(logk)\mathcal{O}(\log k) 的近似。更近期,Lattanzi和Sohler(ICML 2019)提出了LS++,通过局部搜索技术进一步提高k-means++的解质量,以获得 O(1)\mathcal{O}(1) 的近似。实际应用中,k-means++的贪婪变体常被使用,尽管其最坏情况行为被证明优于标准k-means++变体。我们研究如何进一步提高LS++在实际中的性能。我们研究两种改进方案:(a)将LS++与贪婪k-means++组合而非k-means++,以及(b)通过更好地将LS++与Lloyd算法耦合来改进LS++。方案(a)会损害k-means++的理论保证,但我们在实验中确认,结合LS++后也能提高实际质量。方案(b)是我们新的算法,称为Foresight LS++。我们通过实验表明,FLS++在解质量方面优于LS++,同时保持其渐近运行时间和最坏情况近似界。

关键词

引用

@article{arxiv.2406.02739,
  title  = {Local Search k-means++ with Foresight},
  author = {Theo Conrads and Lukas Drexler and Joshua Könen and Daniel R. Schmidt and Melanie Schmidt},
  journal= {arXiv preprint arXiv:2406.02739},
  year   = {2024}
}