中文

大规模并行热力图排序及其在可解释聚类中的应用

数据结构与算法 2023-09-15 v1 分布式、并行与集群计算 机器学习

摘要

给定一组带有 kk 个标签的点,我们引入热力图排序问题,即在保持簇(标签)不变的前提下对点和维度进行重排与合并。若簇保持连通,即未被拆分为多个簇且任意两个簇未被合并,则称该簇被保留。我们证明该问题是 NP-hard 的,并在大规模并行计算模型中给出了一个具有常数轮数、每台机器拥有亚线性内存且机器总内存为线性的固定参数算法。我们针对该问题的一个 NP-hard 特殊情形给出了近似算法。我们使用基于局部敏感哈希的降维方法,在多个有向与无向的电子邮件及计算机网络图上,将我们的算法与 k-means 和基于密度的聚类(DBSCAN)进行了实证比较。

关键词

引用

@article{arxiv.2309.07486,
  title  = {Massively-Parallel Heat Map Sorting and Applications To Explainable Clustering},
  author = {Sepideh Aghamolaei and Mohammad Ghodsi},
  journal= {arXiv preprint arXiv:2309.07486},
  year   = {2023}
}