Fast-VAT:使用 Cython 和 Numba 加速聚类倾向可视化
机器学习
2025-07-23 v1 神经与进化计算
摘要
聚类倾向可视化(VAT)是一种广泛用于评估无标签数据集中是否存在聚类结构的无监督技术。然而,其标准实现因 O(n^2) 的时间复杂度和低效的内存使用而存在显著的性能局限。本文提出了 Fast-VAT,这是一种基于 Python 实现的 VAT 算法高性能重写,采用 Numba 的即时编译(JIT)和 Cython 的静态类型及低级内存优化。我们的方法相对于基线实现可实现最高 50 倍的加速,同时保持原始方法的输出保真度。我们在包括鸢尾花、购物中心客户和 Spotify 子集等实用和合成数据集上对 Fast-VAT 进行了验证,并使用 Hopkins 统计量、PCA 和 t-SNE 验证聚类倾向。此外,我们将 VAT 的结构洞察与 DBSCAN 和 K-Means 的聚类结果进行比较,以确认其可靠性。
关键词
引用
@article{arxiv.2507.15904,
title = {Fast-VAT: Accelerating Cluster Tendency Visualization using Cython and Numba},
author = {MSR Avinash and Ismael Lachheb},
journal= {arXiv preprint arXiv:2507.15904},
year = {2025}
}
备注
10 pages, 3 figures, 3 tables. Code available at https://github.com/Ashx098/VAT-Optimized