一种用于样本外及大规模数据基于表示的子空间聚类的统一框架
机器学习
2017-05-17 v2 计算机视觉与模式识别
机器学习
摘要
在谱聚类框架下,子空间聚类的关键在于构建一个描述数据点邻域关系的相似图。近期一些工作利用稀疏、低秩和基于-范数的表示来构建该图,并取得了最先进的性能。然而,这些方法存在以下两个局限性。首先,这些方法的时间复杂度至少与数据量的立方成正比,这使得它们在解决大规模问题时效率低下。其次,它们无法处理未用于构建相似图的样本外(out-of-sample)数据。为了对每个样本外数据进行聚类,这些方法必须重新计算整个数据集的相似图和聚类成员归属。在本文中,我们提出了一种统一框架,使基于表示的子空间聚类算法能够对样本外数据和大规模数据进行聚类。在我们的框架下,大规模问题通过“采样、聚类、编码和分类”的方式转化为样本外问题来解决。此外,我们将每个子空间视为超空间中的一个点,从而给出了误差界的估计。在多个基准数据集上的大量实验结果表明,我们的方法在大规模数据集聚类方面优于几种近期提出的可扩展方法。
引用
@article{arxiv.1309.6487,
title = {A Unified Framework for Representation-based Subspace Clustering of Out-of-sample and Large-scale Data},
author = {Xi Peng and Huajin Tang and Lei Zhang and Zhang Yi and Shijie Xiao},
journal= {arXiv preprint arXiv:1309.6487},
year = {2017}
}
备注
in IEEE Trans. on Neural Networks and Learning Systems, 2015