中文

统一信息论与配对计数的聚类相似度

机器学习 2025-11-06 v1 信息论 机器学习 math.IT

摘要

比较聚类结果是评估无监督模型的核心,然而现有的众多相似度度量可能产生广泛分歧、有时甚至矛盾的评估结果。聚类相似度度量通常被组织成两个主要家族:配对计数和信息论,这反映了它们是通过元素对还是通过整个聚类列联表的聚合信息来量化一致性。先前的工作已揭示了这两个家族之间的相似之处,并应用了经验归一化或机会校正方案,但它们更深层的分析联系仍仅被部分理解。在此,我们通过两个互补的视角,发展了一个统一这两个家族的分析框架。首先,两个家族都被表示为观测与期望共现的加权展开,其中配对计数表现为二次的低阶近似,而信息论度量表现为高阶的频率加权扩展。其次,我们将配对计数推广到k元组一致性,并表明信息论度量可以被视为系统地累积了超出成对水平的高阶共分配结构。我们针对Rand指数和互信息从分析上阐述了这些方法,并展示了每个家族中的其他指数如何作为自然扩展出现。这些观点共同阐明了两种机制何时以及为何产生分歧,将其敏感性直接与权重和近似阶数联系起来,并为跨应用选择、解释和扩展聚类相似度度量提供了原则性基础。

关键词

引用

@article{arxiv.2511.03000,
  title  = {Unifying Information-Theoretic and Pair-Counting Clustering Similarity},
  author = {Alexander J. Gates},
  journal= {arXiv preprint arXiv:2511.03000},
  year   = {2025}
}

备注

28 pages, 2 figures