基于离散密度模型的线性密度聚类
机器学习
2018-07-24 v1 机器学习
摘要
密度聚类技术被广泛应用于各类数据挖掘任务中。其最具吸引力的特点之一是不需要预先知道数据集所包含的簇的数量及其形状。本文提出一种名为Linear DBSCAN(Lin-DBSCAN)的新算法,这是一种受著名算法DBSCAN所引入的密度模型启发的简单聚类方法。Lin-DBSCAN旨在最小化地理空间数据上密度聚类的计算成本,具有线性时间复杂度,适用于低资源设备上的实时应用。Lin-DBSCAN使用DBSCAN密度模型的离散版本,利用基于网格的扫描与合并方法。算法名称正源于上述主要特征。该算法在知名数据集上进行了测试。实验结果证明了该方法相对于DBSCAN在空间数据聚类场景下的效率与有效性,使得能够以低计算成本在大型数据集上使用密度聚类技术。
引用
@article{arxiv.1807.08158,
title = {Linear density-based clustering with a discrete density model},
author = {Roberto Pirrone and Vincenzo Cannella and Sergio Monteleone and Gabriella Giordano},
journal= {arXiv preprint arXiv:1807.08158},
year = {2018}
}
备注
40 pages, 9 figures, 9 tables, 4 listings