中文

J-Score:一种鲁棒的聚类准确性度量

机器学习 2021-09-06 v1

摘要

背景。聚类分析通过将数据集划分为互不相交的簇来发现其中隐藏的结构。评估聚类结果优劣的鲁棒准确性度量对于算法开发和模型诊断至关重要。当前聚类准确性度量的常见问题包括忽视未匹配簇、对过多簇的偏置、不稳定的基线以及难以解释。在本研究中,我们提出一种新颖的准确性度量J-score,以解决这些问题。方法。给定一个具有已知类标签的数据集,J-score量化聚类分析产生的假设簇在多大程度上恢复了真实类。它从双向集合匹配开始,基于Jaccard指数确定真实类与假设簇之间的对应关系。然后计算两个Jaccard指数的加权和,分别衡量从类到簇以及反向的吻合程度。最终的J-score是两个加权和的调和平均。结果。通过模拟研究,我们评估了J-score的性能并与现有度量进行比较。我们的结果表明,J-score能有效区分仅因未匹配簇而不同的划分结构,奖励对类数的正确推断,解决对过多簇的偏置,并具有相对稳定的基线。其计算的简单性使解释直观。它是补充其他准确性度量的有价值工具。我们发布了实现该算法的R/jScore包。

关键词

引用

@article{arxiv.2109.01306,
  title  = {J-Score: A Robust Measure of Clustering Accuracy},
  author = {Navid Ahmadinejad and Li Liu},
  journal= {arXiv preprint arXiv:2109.01306},
  year   = {2021}
}