面向高维数据的多多样化集成聚类:从子空间到度量及其超越
机器学习
2021-09-07 v5 计算机视觉与模式识别
摘要
高维数据在各个领域的迅速涌现给当前的集成聚类研究带来了新的挑战。为了应对维度灾难,近期集成聚类领域通过不同的子空间技术做出了大量努力。然而,除了对子空间的强调外,对相似性/不相似性度量中潜在多样性的关注却相当有限。如何在集成聚类中创建并聚合大量多样化的度量,以及如何在一个统一框架中联合研究度量、子空间和聚类这三个层面的大规模多样性,仍然是一个令人惊讶的开放问题。为解决这一问题,本文提出了一种新颖的多多样化集成聚类方法。具体而言,我们通过随机化一个缩放的指数相似性核来创建大量多样化的度量,然后将这些度量与随机子空间耦合,形成一组大规模的度量-子空间对。基于这些度量-子空间对导出的相似性矩阵,可以构建一个多样化的基聚类集成。进一步地,利用基于熵的准则来探索集成中聚类层面的多样性,并在此基础上通过结合三种共识函数,提出了三种具体的集成聚类算法。在 30 个高维数据集(包括 18 个癌症基因表达数据集和 12 个图像/语音数据集)上进行了大量实验,结果表明我们的算法优于现有最优方法。源代码可在 https://github.com/huangdonghere/MDEC 获取。
引用
@article{arxiv.1710.03113,
title = {Toward Multidiversified Ensemble Clustering of High-Dimensional Data: From Subspaces to Metrics and Beyond},
author = {Dong Huang and Chang-Dong Wang and Jian-Huang Lai and Chee-Keong Kwoh},
journal= {arXiv preprint arXiv:1710.03113},
year = {2021}
}
备注
Accepted by IEEE Transactions on Cybernetics. The MATLAB source code is available at https://github.com/huangdonghere/MDEC