近邻诱导的隔离相似度及其对基于密度聚类的影响
机器学习
2024-01-30 v1 机器学习
摘要
近期提出的一种称为隔离核/相似度(Isolation Kernel/Similarity)的数据依赖相似度已使 SVM 取得更好的分类准确率。我们指出了使用树方法实现隔离相似度的缺陷,并转而提出一种近邻方法。我们借助所提方法形式化证明了隔离相似度的特征。本文研究了隔离相似度对基于密度的聚类的影响。我们首次表明,经典基于密度的聚类算法 DBSCAN 的聚类性能可被显著提升以超越近期的密度峰值聚类算法 DP。这只需在 DBSCAN 中用所提近邻诱导的隔离相似度替换距离度量即可实现,其余步骤不变。我们形式化定义了一种称为质量连通簇(mass-connected clusters)的新型簇。我们表明,当距离度量被所提相似度替换时,检测密度连通簇的 DBSCAN 变为检测质量连通簇的算法。我们还给出了质量连通簇可被检测而密度连通簇无法被检测的条件。
引用
@article{arxiv.1907.00378,
title = {Nearest-Neighbour-Induced Isolation Similarity and its Impact on Density-Based Clustering},
author = {Xiaoyu Qin and Kai Ming Ting and Ye Zhu and Vincent CS Lee},
journal= {arXiv preprint arXiv:1907.00378},
year = {2024}
}