中文

无歧义聚类的保证恢复

信息论 2025-05-09 v3 人工智能 数据结构与算法 机器学习 math.IT 统计理论 统计理论

摘要

聚类常因“正确”聚类的固有歧义而困难。即使已知聚类数KK,歧义仍常存在,尤其当不同簇密度变化且簇内有多个相对分离的高密度区域时。本文提出信息论刻画KK-聚类何时有歧义,并设计算法在无歧义时恢复聚类。该刻画形式化了簇内两个高密度区域可分离到看起来更像两个不同簇而非KK-聚类中两个真正不同簇的情形。算法首先用基于密度的方法识别KK个部分簇(或“种子”),然后以贪婪方式将未聚类点添加到初始KK个部分簇形成完整聚类。我们实现并测试了修改版算法以有效处理重叠簇,观察到它需要很少参数选择,并在许多数据集上比广泛使用的非凸簇恢复算法表现更好。

关键词

引用

@article{arxiv.2501.13093,
  title  = {Guaranteed Recovery of Unambiguous Clusters},
  author = {Kayvon Mazooji and Ilan Shomorony},
  journal= {arXiv preprint arXiv:2501.13093},
  year   = {2025}
}

备注

12 pages, includes minor changes and some new content compared to previous version