CNMBI:基于中心两两匹配与边界过滤确定聚类数目
计算机视觉与模式识别
2026-03-31 v1
摘要
数据挖掘中的一个主要挑战是如何在没有先验信息的情况下选择最佳聚类数。值得注意的是,现有方法通常遵循聚类验证的哲学,因而对数据分布有所假设,这会阻碍其应用于复杂数据,如大规模图像和来自实际场景的高维数据。在此基础上,我们提出一种名为CNMBI的方法。该方法利用数据空间中固有的分布信息,将目标任务映射为聚类中心之间关于位置行为的动态比较过程,无需依赖完整的聚类结果,也无需设计复杂的有效性指数。随后,我们采用二分图理论来高效地建模这一过程。此外,我们发现不同样本具有不同的置信水平,从而主动删除低置信度的样本,这在聚类数目确定中首次被认为是可能的。CNMBI具有鲁棒性,可应用于更灵活的数据维度和形状(例如CIFAR-10和STL-10)。在各种具有挑战性的数据集上与最先进的方法进行的广泛比较研究表明,我们方法的优越性。
引用
@article{arxiv.2603.26744,
title = {CNMBI: Determining the Number of Clusters Using Center Pairwise Matching and Boundary Filtering},
author = {Ruilin Zhang and Haiyang Zheng and Hongpeng Wang},
journal= {arXiv preprint arXiv:2603.26744},
year = {2026}
}