模糊K均值问题的复杂性与近似算法
机器学习
2015-12-21 v1 数据结构与算法
摘要
模糊-均值问题是经典-均值问题在软聚类(即每个点以某种程度属于每个簇的聚类)上的推广。尽管在实践中流行,在此之前该问题尚未从计算复杂性理论或算法角度被研究。我们表明,一般而言,模糊-均值的最优解不能由输入点的根式表示。令人惊讶的是,即使在一维空间中非常简单的输入也是如此。因此,不能期望精确计算最优解。我们给出首个用于模糊-均值问题的-近似算法。首先,我们提出一种确定性近似算法,其运行时间在中为多项式,在输入集维度中为线性,给定为常数,即给定固定的多项式时间近似算法。我们通过证明对于每个软聚类存在一个具有可比性质的硬聚类来实现此结果。其次,利用从-均值问题的核心集构造已知的技术,我们开发了确定性近似算法,其运行时间几乎在中线性,但在维度中指数级。我们用一个随机算法补充这些结果,该算法对输入集施加一些自然限制,其运行时间与某些最有效的-均值近似算法相当,即在点数和维度上线性,但在簇数量上指数级。
引用
@article{arxiv.1512.05947,
title = {Complexity and Approximation of the Fuzzy K-Means Problem},
author = {Johannes Blömer and Sascha Brauer and Kathrin Bujna},
journal= {arXiv preprint arXiv:1512.05947},
year = {2015}
}