中文

大数据背景下K-means聚类优化策略的比较分析:综述

机器学习 2024-05-21 v3 人工智能 最优化与控制

摘要

本文对大数据背景下 K-means 算法的不同优化技术进行了比较分析。K-means 是一种广泛使用的聚类算法,但在处理大规模数据集时可能面临可扩展性问题。本文探讨了克服这些问题的不同方法,包括并行化、近似和采样方法。作者在大量基准数据集上评估了各种聚类技术的性能,依据“少即是多”方法(LIMA)所提供的优势准则进行比较,即同时沿速度、聚类质量和简洁性维度。结果表明,不同技术更适用于不同类型的数据集,并揭示了大数据 K-means 聚类中速度与准确性之间的权衡。总体而言,本文为从业者和研究者如何优化 K-means 用于大数据应用提供了全面指南。

关键词

引用

@article{arxiv.2310.09819,
  title  = {Comparative Analysis of Optimization Strategies for K-means Clustering in Big Data Contexts: A Review},
  author = {Ravil Mussabayev and Rustam Mussabayev},
  journal= {arXiv preprint arXiv:2310.09819},
  year   = {2024}
}

备注

Submitted to the "Expert Systems with Applications" journal