IPD:一种面向大规模数据并带簇代表点的基于增量原型的 DBSCAN
机器学习
2023-10-12 v2 计算机视觉与模式识别
数据库
摘要
DBSCAN 是一种基础的基于密度的聚类技术,可识别任意形状的簇。然而,在处理大数据时它变得不可行。另一方面,基于质心的聚类对检测数据集中的模式十分重要,因为未处理的数据点可被标记到其最近质心。但它无法检测非球形簇。对于大数据,存储和计算每个样本的标签不可行。这些可在信息需要时再行完成。当聚类作为识别簇代表点并通过对最近代表点分配簇标签来服务查询的工具时,该目的即可达成。在本文中,我们提出一种基于增量原型的 DBSCAN(IPD)算法,旨在为大规模数据识别任意形状簇。此外,它为 each 簇选择一组代表点。
引用
@article{arxiv.2202.07870,
title = {IPD:An Incremental Prototype based DBSCAN for large-scale data with cluster representatives},
author = {Jayasree Saha and Jayanta Mukherjee},
journal= {arXiv preprint arXiv:2202.07870},
year = {2023}
}