中文

最先进的混合数据聚类算法综述

机器学习 2019-03-20 v6 人工智能 机器学习

摘要

混合数据同时包含数值型和类别型特征,且混合数据集频繁出现于健康、金融和营销等诸多领域。聚类常被应用于混合数据集以发现结构并将相似对象分组以便进一步分析。然而,混合数据聚类具有挑战性,因为难以直接对这些数据集的特征值施加求和或平均等数学运算。本文通过确定五大研究主题,提出混合数据聚类算法研究的分类法。随后,我们对各研究主题内的研究工作进行最先进水平的综述。我们分析了这些方法的优势与劣势,并指明未来研究方向。最后,我们深入分析了该领域的整体挑战,突出开放研究问题并讨论推进该领域的指导原则。

关键词

引用

@article{arxiv.1811.04364,
  title  = {Survey of state-of-the-art mixed data clustering algorithms},
  author = {Amir Ahmad and Shehroz S. Khan},
  journal= {arXiv preprint arXiv:1811.04364},
  year   = {2019}
}

备注

20 Pages, 2 columns, 6 Tables, 209 References