中文

带异常点的容量约束/公平聚类的固定参数可处理近似算法

数据结构与算法 2023-05-03 v1

摘要

聚类问题如 kk-Median 和 kk-Means,其应用动机来自选址规划、无监督学习等。在此类应用中,找到在点的数量上不“偏斜”的点的聚类十分重要,即任何簇都不应包含过多点。这通过簇大小上的容量约束来建模。在另一个正交方向上,聚类中的另一个重要考量是如何处理数据中异常点的存在。事实上,这些聚类问题在文献中已被分别推广以单独处理容量约束和异常点。据我们所知,关于能同时处理容量和异常点的聚类问题可近似性的研究极少。我们开启了带异常点的容量约束 kk-Median(CkkMO)问题的研究。此处,我们希望将所有点中除 mm 个异常点外的点聚类到至多 kk 个簇中,使得(i)簇满足容量约束,且(ii)聚类代价(定义为每个非异常点到其指派簇中心的距离之和)被最小化。我们设计了首个针对 CkkMO 的常数因子近似算法。具体而言,我们的算法在一般度量空间中返回 CkkMO 的 (3+ε)-近似,在常数维欧几里得空间中返回 (1+ε)-近似,其运行时间为 f(k,m,ϵ)ImO(1)f(k, m, \epsilon) \cdot |I_m|^{O(1)},其中 Im|I_m| 表示输入规模。我们还可将这些结果扩展到更广泛的问题类,包括带异常点的容量约束 k-Means/k-Facility Location,以及带异常点的尺寸均衡公平聚类问题。对其中每个问题,我们获得的近似比与对应无异常点问题的最佳已知保证相匹配。

关键词

引用

@article{arxiv.2305.01471,
  title  = {FPT Approximations for Capacitated/Fair Clustering with Outliers},
  author = {Rajni Dabas and Neelima Gupta and Tanmay Inamdar},
  journal= {arXiv preprint arXiv:2305.01471},
  year   = {2023}
}

备注

Abstract shortened to meet arxiv requirements