用于优化非穷尽重叠聚类的快速乘子法
机器学习
2016-02-08 v1
摘要
聚类是数据挖掘中最基础且最重要的任务之一。传统的聚类算法,如 K-means,将每个数据点精确分配给一个簇。然而,在真实数据集中,簇之间可能相互重叠。此外,常常存在不应属于任何簇的离群点。我们最近提出了 NEO-K-Means(非穷尽、重叠 K-Means)目标,以集成方式解决这两个问题。优化该离散目标是 NP-hard 的,并且尽管存在该目标的凸松弛,直接的凸优化方法对于大型数据集过于昂贵。一个实用的替代方案是在凸公式中使用解矩阵的低秩分解。所得的优化问题是非凸的,我们可以使用增广拉格朗日法局部优化目标函数。在本文中,我们考虑两种快速乘子法来加速增广拉格朗日格式的收敛:近端乘子法和交替方向乘子法(ADMM)。对于近端增广拉格朗日法或近端乘子法,我们给出了具有边界约束子问题的非凸情形的收敛结果。与标准增广拉格朗日法相比,这些方法在超过 10,000 个变量的问题上最高快 13 倍——质量不变——并将运行时间从超过一小时降至约 5 分钟。
引用
@article{arxiv.1602.01910,
title = {Fast Multiplier Methods to Optimize Non-exhaustive, Overlapping Clustering},
author = {Yangyang Hou and Joyce Jiyoung Whang and David F. Gleich and Inderjit S. Dhillon},
journal= {arXiv preprint arXiv:1602.01910},
year = {2016}
}
备注
9 pages. 2 figures