中文

曼哈顿距离与坦尼莫距离下的快速且可解释聚类

机器学习 2026-01-14 v1

摘要

CLASSIX算法是一种快速且可解释的数据聚类方法。其原始形式利用数据点按第一个主成分排序,以截断寻找相邻数据点的搜索范围,其中相近性基于欧几里得距离定义。本文将CLASSIX扩展到其他距离度量,包括曼哈顿距离和坦尼莫距离。我们不使用主成分,而是采用数据向量的合适范数作为排序准则,结合三角不等式实现搜索终止。在坦尼莫距离的情况下,采用可证明更尖锐的交叉不等式进一步提升新算法的性能。在一个真实的化学指纹基准测试上,CLASSIX 坦尼莫比Taylor-Butina算法快约30倍,比DBSCAN快约80倍,同时在两种情况下均得到更高质量的簇。

关键词

引用

@article{arxiv.2601.08781,
  title  = {Fast and explainable clustering in the Manhattan and Tanimoto distance},
  author = {Stefan Güttel and Kaustubh Roy},
  journal= {arXiv preprint arXiv:2601.08781},
  year   = {2026}
}