基于概率生成邻域的基于密度的空间线聚类
机器学习
2024-10-04 v1
摘要
基于密度的空间聚类在 中的点具有众多应用,广泛应用于多个行业。我们将此问题推广到高维空间中基于密度的线聚类,同时意识到存在不存在满足三角不等式的有效距离度量。本文设计了一个聚类算法,为固定体积(以参数形式给出)的线生成自定义邻域,基于可选参数作为连续概率密度函数。这一算法对异常值不敏感,并且能够有效地使用基数参数识别数据中的噪声。这一算法的一个关键应用是聚类包含缺失条目的数据点,同时利用各自数据的领域知识。特别地,所提出的算法能够聚类包含至少 维信息的 维数据点。我们展示了标准概率分布的邻域,并演示了该算法在各种合成和真实世界数据集(例如铁路和道路网络)上的有效性。实验结果还强调了其在聚类不完整数据方面的应用。
引用
@article{arxiv.2410.02290,
title = {Density based Spatial Clustering of Lines via Probabilistic Generation of Neighbourhood},
author = {Akanksha Das and Malay Bhattacharyya},
journal= {arXiv preprint arXiv:2410.02290},
year = {2024}
}