通过非负低秩半定规划实现统计最优的K-means聚类
机器学习
2024-04-16 v5 机器学习
最优化与控制
摘要
-means聚类是一种广泛用于大规模数据集中模式识别的机器学习方法。近来,半定规划(SDP)松弛被提出用于求解-means优化问题,其具备较强的统计最优性保证。然而,实现SDP求解器的高昂代价使得这些保证无法应用于实际数据集。相比之下,非负矩阵分解(NMF)是一种被机器学习从业者广泛使用的简单聚类算法,但缺乏坚实的统计基础与理论保证。本文考虑一种类NMF算法,其采用非凸Burer--Monteiro分解方法求解SDP松弛-means公式的非负低秩限制。所得算法与最先进NMF算法一样简单且可扩展,同时享有与SDP相同的强统计最优性保证。在我们的实验中,我们观察到该算法相比现有最先进技术实现了显著更小的误聚类误差,同时保持可扩展性。
引用
@article{arxiv.2305.18436,
title = {Statistically Optimal K-means Clustering via Nonnegative Low-rank Semidefinite Programming},
author = {Yubo Zhuang and Xiaohui Chen and Yun Yang and Richard Y. Zhang},
journal= {arXiv preprint arXiv:2305.18436},
year = {2024}
}
备注
Accepted to ICLR 2024