中文

FISHDBC:面向任意数据和距离的灵活、增量、可扩展、分层密度聚类算法

机器学习 2019-10-17 v1 数据结构与算法 机器学习

摘要

FISHDBC 是一种灵活、增量、可扩展且分层的基于密度的聚类算法。其灵活性在于它使用户能够处理任意数据,跳过通常将原始数据转换为数值数组的特征提取步骤,转而让用户定义任意距离函数。它具有增量性和可扩展性:避免了其他方法在非度量空间中的 O(n2)\mathcal O(n^2) 性能,并且在添加少量项目时仅需轻量级计算即可更新聚类。它具有分层性:生成一个可扩展为树结构的“扁平”聚类,以便用户在数据探索需要时,将聚类分组或划分为子聚类或超聚类。它基于密度,并近似于 DBSCAN 的演进版本 HDBSCAN*。

关键词

引用

@article{arxiv.1910.07283,
  title  = {FISHDBC: Flexible, Incremental, Scalable, Hierarchical Density-Based Clustering for Arbitrary Data and Distance},
  author = {Matteo Dell'Amico},
  journal= {arXiv preprint arXiv:1910.07283},
  year   = {2019}
}