中文

抗误差的多视图聚类

机器学习 2018-01-03 v1

摘要

在大数据时代,数据可能来自多个来源,称为多视图数据。多视图聚类的目标是通过利用多个视图中的互补与一致信息而非依赖单个视图来生成更好的聚类。由于数据采集传感器或其他因素导致的不可避免的系统误差,每个视图中的数据都可能存在错误。各类误差在每个视图中的表现不同且不一致。更确切地说,误差在现实中可表现为噪声与损坏。遗憾的是,现有多视图聚类方法均未能处理所有这些误差类型,因此其聚类性能大幅下降。本文提出一种用于抗误差多视图聚类(EMVC)的新颖马尔可夫链方法。通过将每个视图分解为共享转移概率矩阵与误差矩阵,并对误差矩阵施加结构化稀疏诱导范数,我们显式地刻画并处理典型误差类型。为求解这一具挑战性的优化问题,我们提出一种基于增广拉格朗日乘子(Augmented Lagrangian Multipliers)的新高效算法,并严格证明其收敛性。在多个合成与真实数据集上的实验结果表明,所提 EMVC 方法优于基线方法,且对各类误差具有鲁棒性。

关键词

引用

@article{arxiv.1801.00384,
  title  = {Error-Robust Multi-View Clustering},
  author = {Mehrnaz Najafi and Lifang He and Philip S. Yu},
  journal= {arXiv preprint arXiv:1801.00384},
  year   = {2018}
}

备注

10 pages, 2017 IEEE International Conference on Big Data (Big Data 2017)