曼哈顿距离与坦尼莫距离下的快速且可解释聚类
机器学习
2026-01-14 v1
摘要
CLASSIX算法是一种快速且可解释的数据聚类方法。其原始形式利用数据点按第一个主成分排序,以截断寻找相邻数据点的搜索范围,其中相近性基于欧几里得距离定义。本文将CLASSIX扩展到其他距离度量,包括曼哈顿距离和坦尼莫距离。我们不使用主成分,而是采用数据向量的合适范数作为排序准则,结合三角不等式实现搜索终止。在坦尼莫距离的情况下,采用可证明更尖锐的交叉不等式进一步提升新算法的性能。在一个真实的化学指纹基准测试上,CLASSIX 坦尼莫比Taylor-Butina算法快约30倍,比DBSCAN快约80倍,同时在两种情况下均得到更高质量的簇。
引用
@article{arxiv.2601.08781,
title = {Fast and explainable clustering in the Manhattan and Tanimoto distance},
author = {Stefan Güttel and Kaustubh Roy},
journal= {arXiv preprint arXiv:2601.08781},
year = {2026}
}