带异常点的容量约束/公平聚类的固定参数可处理近似算法
数据结构与算法
2023-05-03 v1
摘要
聚类问题如 -Median 和 -Means,其应用动机来自选址规划、无监督学习等。在此类应用中,找到在点的数量上不“偏斜”的点的聚类十分重要,即任何簇都不应包含过多点。这通过簇大小上的容量约束来建模。在另一个正交方向上,聚类中的另一个重要考量是如何处理数据中异常点的存在。事实上,这些聚类问题在文献中已被分别推广以单独处理容量约束和异常点。据我们所知,关于能同时处理容量和异常点的聚类问题可近似性的研究极少。我们开启了带异常点的容量约束 -Median(CMO)问题的研究。此处,我们希望将所有点中除 个异常点外的点聚类到至多 个簇中,使得(i)簇满足容量约束,且(ii)聚类代价(定义为每个非异常点到其指派簇中心的距离之和)被最小化。我们设计了首个针对 CMO 的常数因子近似算法。具体而言,我们的算法在一般度量空间中返回 CMO 的 (3+ε)-近似,在常数维欧几里得空间中返回 (1+ε)-近似,其运行时间为 ,其中 表示输入规模。我们还可将这些结果扩展到更广泛的问题类,包括带异常点的容量约束 k-Means/k-Facility Location,以及带异常点的尺寸均衡公平聚类问题。对其中每个问题,我们获得的近似比与对应无异常点问题的最佳已知保证相匹配。
引用
@article{arxiv.2305.01471,
title = {FPT Approximations for Capacitated/Fair Clustering with Outliers},
author = {Rajni Dabas and Neelima Gupta and Tanmay Inamdar},
journal= {arXiv preprint arXiv:2305.01471},
year = {2023}
}
备注
Abstract shortened to meet arxiv requirements