大规模数据亲和传播聚类的局部与全局方法
机器学习
2009-10-12 v1 计算机视觉与模式识别
摘要
最近提出了一种名为“亲和传播”(AP)的新聚类算法,该算法通过在数据点之间传递消息来高效聚类稀疏相关数据。然而,我们希望对大规模数据进行聚类,而在许多情况下相似度矩阵并不稀疏。本文提出了两种AP的变体,用于对具有稠密相似度矩阵的大规模数据进行分组。局部方法是分区亲和传播(PAP),全局方法是地标亲和传播(LAP)。PAP首先在数据子集中传递消息,然后在初始迭代步数时合并它们;它可以有效减少聚类的迭代次数。LAP首先在地标数据点之间传递消息,然后对非地标数据点进行聚类;它是一种加速聚类的大规模全局近似方法。在多个数据集上进行了实验,例如随机数据点、流形子空间、人脸图像和中国书法,结果表明这两种方法是可行且实用的。
引用
@article{arxiv.0910.1650,
title = {Local and global approaches of affinity propagation clustering for large scale data},
author = {Dingyin Xia and Fei Wu and Xuqing Zhang and Yueting Zhuang},
journal= {arXiv preprint arXiv:0910.1650},
year = {2009}
}
备注
9 pages