基于最小曲线稀疏相似度的非线性马尔可夫聚类
机器学习
2019-12-30 v1 机器学习
摘要
开发用于非线性聚类无监督模式识别的算法是数据科学中的一个显著问题。马尔可夫聚类(MCL)是一种著名算法,它模拟样本相似度网络上的随机流以检测数据中簇的结构组织,但它从未被推广以处理数据非线性。最小曲线性(MC)是一种原理,通过曲线距离近似高维特征空间中的非线性样本距离,这些曲线距离作为在其最小生成树上的横截路径计算,然后存储于核中。在此我们提出 MC-MCL,它是 MCL 的首个非线性核扩展,并利用最小曲线性增强 MCL 在具有潜在非线性模式的真实与合成数据上的性能。MC-MCL 与包括 DBSCAN、K-means 和 affinity propagation 在内的基线聚类方法进行比较。我们发现最小曲线性提供了一个有价值的框架来估计非线性距离,即使其核与 MCL 结合使用时亦然。事实上,MC-MCL 在不同非线性数据集中克服了经典 MCL 甚至基线聚类算法。
引用
@article{arxiv.1912.12211,
title = {Nonlinear Markov Clustering by Minimum Curvilinear Sparse Similarity},
author = {C. Duran and A. Acevedo and S. Ciucci and A. Muscoloni and CV. Cannistraci},
journal= {arXiv preprint arXiv:1912.12211},
year = {2019}
}