调整调整兰德指数——一个多项分布故事
统计方法学
2020-11-18 v1
摘要
调整兰德指数()无疑是聚类比较中最流行的度量之一。 的调整基于超几何分布假设,从建模角度看这不令人满意,因为(i)当两个聚类相关时不适用,(ii)它强制了簇的大小,以及(iii)它忽略了抽样的随机性。本工作中,我们提出兰德指数的一个新“修正”版本。首先,我们重新定义 ,仅统计因相似性一致的配对而忽略因差异性一致的配对,提升了分数的可解释性。其次,我们将调整版本 建立在多项分布而非超几何分布之上。多项模型具有优势,因为它不强制簇的大小、恰当建模随机性,且易于扩展到相关情形。我们表明 在多项模型下是有偏的,且 与 之差在小的 时可很大,但在大的 时基本消失,其中 为个体数。最后,我们通过在 \texttt{aricode} 包中依赖列联表的稀疏表示,提供了高效计算所有这些量( 与 )的算法。其空间与时间复杂度在样本数上呈线性,且重要的是不依赖于簇数,因为我们不显式计算列联表。
引用
@article{arxiv.2011.08708,
title = {Adjusting the adjusted Rand Index -- A multinomial story},
author = {Martina Sundqvist and Julien Chiquet and Guillem Rigaill},
journal= {arXiv preprint arXiv:2011.08708},
year = {2020}
}
备注
21 pages, 2 figures