中文

分布式环境下大数据聚类最先进方法综述

分布式、并行与集群计算 2022-11-11 v1

摘要

大数据处理系统处理海量非结构化和结构化数据,通过聚类分析进行存储、处理和分析,这有助于识别未见模式以发现它们之间的关系。大数据技术中共享机器上的聚类分析有助于利用上下文数据推导关系并做出决策。它可以处理各种形式的原始、表格数据以及结构化、半结构化和非结构化数据。数据不需要具备线性属性。它可以反映关联和相关模式及分组。本文的主要贡献和发现是收集并总结了最近的大数据聚类技术,及其在任何分布式环境中的优势和劣势。

关键词

引用

@article{arxiv.2211.05339,
  title  = {Writing summary for the state-of-the-art methods for big data clustering in distributed environment},
  author = {Dipesh Gyawali},
  journal= {arXiv preprint arXiv:2211.05339},
  year   = {2022}
}

备注

4 Pages