中文

基于加权不纯度度量的聚类近似算法

数据结构与算法 2018-07-17 v1

摘要

不纯度度量 I:RkR+I:{R}^k \to {R}^+kk 维向量 v{\bf v} 映射为非负值 I(v)I({\bf v}),且 v{\bf v} 越同质,其不纯度越大。我们研究基于不纯度度量的聚类:给定 nnkk 维向量组成的集合 VV 与不纯度度量 II,目标是找到 VV 划分为 LL 个组 V1,,VLV_1,\ldots,V_L 的划分 P{\cal P},使组中总不纯度最小,即 I(P)=m=1LI(vVmv).I({\cal P})= \sum_{m=1}^{L} I(\sum_{{\bf v} \in V_m}{\bf v}). 不纯度最小化被广泛用作概率分布聚类和类别聚类中的质量评估度量,在这类聚类中无法依赖数据集的几何性质。然而,与基于度量的聚类不同,当前关于基于不纯度度量的聚类在近似与不可近似性结果方面的知识非常有限。我们的研究有助于填补这一空白。我们首先给出一个简单线性时间算法,同时对 Gini 不纯度度量达到 33-近似,对 Entropy 不纯度度量达到 O(log(vVv1))O(\log(\sum_{{\bf v} \in V} \| {\bf v} \|_1))-近似。进而,对于 Entropy 不纯度度量——我们也证明了寻找最优聚类是强 NP 难的——我们能够设计一个多项式时间 O(log2(min{k,L}))O(\log^2(\min\{k,L\}))-近似算法。我们的算法依赖于对一类聚类的非平凡刻画,该类聚类必然包含达到最优划分不纯度 O(log2(min{k,L}))O(\log^2(\min\{k,L\})) 近似的划分。值得注意的是,这是首个不依赖于点数/向量数量、且不依赖向量分量任何限制、具有近似保证的多项式时间最小熵聚类算法。

关键词

引用

@article{arxiv.1807.05241,
  title  = {Approximation Algorithms for Clustering via Weighted Impurity Measures},
  author = {Ferdinando Cicalese and Eduardo Laber},
  journal= {arXiv preprint arXiv:1807.05241},
  year   = {2018}
}