中文

CEREAL:少样本聚类评估

机器学习 2022-10-04 v1

摘要

使用归一化互信息(NMI)等可靠评估指标评价聚类质量需要标注数据,而标注可能代价高昂。我们关注以有限标注估计聚类质量这一未被充分探索的问题。我们将少样本模型评估文献中的现有方法改造为:用学习的代理模型主动子采样最具信息量的数据点供标注,以估计评估指标。然而,我们发现其估计可能有偏且仅依赖标注数据。为此,我们提出 CEREAL,一个全面的少样本聚类评估框架,从三个关键方面扩展主动采样方法。首先,我们提出新颖的基于 NMI 的采集函数,考量聚类的独特属性及来自学习代理模型的不确定性。其次,我们利用半监督学习思想,用标注与未标注数据共同训练代理模型。最后,我们用代理模型对未标注数据作伪标注。我们在视觉与语言三个数据集的主动采样流程中实验估计 NMI。结果显示,相较最佳采样基线,CEREAL 将绝对误差曲线下面积最多降低 57%。我们做了广泛消融实验,表明框架对聚类算法与评估指标的选择不敏感。我们还将 CEREAL 从簇级标注扩展到成对标注。总体而言,CEREAL 能以有限人工标注高效评估聚类。

关键词

引用

@article{arxiv.2210.00064,
  title  = {CEREAL: Few-Sample Clustering Evaluation},
  author = {Nihal V. Nayak and Ethan R. Elenberg and Clemens Rosenbaum},
  journal= {arXiv preprint arXiv:2210.00064},
  year   = {2022}
}