何时物以类聚?k-均值、邻近性与锥规划
最优化与控制
2018-07-24 v3 统计理论
统计理论
摘要
给定一组数据,核心目标之一是根据对象间的相似性概念将其分成簇。尽管寻找全局最小值在计算上很困难,k-均值仍是最流行和广泛使用的方法之一。我们通过将不同的凸松弛与相应的邻近性条件联系起来(这一思想最初由Kumar和Kannan提出),研究并比较这些凸松弛的性质。利用锥对偶理论,我们提出了一个改进的邻近性条件,在该条件下k-均值的Peng-Wei松弛能精确恢复潜在簇。我们的邻近性条件优于Kumar和Kannan的结果,并与Awasthi和Sheffet为投影k-均值建立的邻近性条件相当。此外,我们给出了Peng-Wei松弛精确性的一个必要邻近性条件。对于簇大小相等的特殊情况,我们建立了一个不同且完全局部化的邻近性条件,在该条件下Amini-Levina松弛能实现精确聚类,从而在平衡情况下解决了Awasthi和Sheffet提出的一个开放问题。我们的框架不仅是确定性且无模型的,还具有清晰的几何意义,便于进一步分析和推广。此外,它可方便地应用于分析各种数据生成模型,如随机球模型和高斯混合模型。利用该方法,我们改进了随机球模型的当前最小分离界,并达到了学习高斯混合模型的最先进水平。
引用
@article{arxiv.1710.06008,
title = {When Do Birds of a Feather Flock Together? k-Means, Proximity, and Conic Programming},
author = {Xiaodong Li and Yang Li and Shuyang Ling and Thomas Strohmer and Ke Wei},
journal= {arXiv preprint arXiv:1710.06008},
year = {2018}
}
备注
34 pages, 5 figures