中文

欧氏 k-Means 稳定实例的精确算法与下界

数据结构与算法 2024-02-01 v3

摘要

我们研究了在固定维欧氏度量(更一般地,倍增度量)下求解 kk-Means 与 kk-Median 聚类的稳定或扰动弹性实例的复杂性。稳定(扰动弹性)实例的概念由 Bilu 与 Linial [2010] 以及 Awasthi 等人 [2012] 提出。在我们的语境中,称一个 kk-Means 实例为 α\alpha-稳定的,是指存在唯一的 OPT,且当距离被(非一致地)拉伸不超过 α\alpha 倍时它仍是最优的。稳定聚类实例被用来解释为何诸如 Lloyd 算法之类的启发式方法在实践中表现良好。本工作中我们证明,对任意固定的 ϵ>0\epsilon>0,倍增度量中的 (1+ϵ)(1+\epsilon)-稳定 kk-Means 实例可在多项式时间内求解。更确切地说,我们证明一种自然的多交换局部搜索算法能在多项式次迭代内为 (1+ϵ)(1+\epsilon)-稳定的 kk-Means 与 kk-Median 实例找到 OPT。我们以一个新 PCP 定理补充该结果,表明这本质上是最优的:当维数 d 作为输入一部分时,存在固定 ϵ0>0\epsilon_0>0,使得在 NP=RP 不成立时对 RdR^d(1+ϵ0)(1+\epsilon_0)-稳定 kk-Means 甚至不存在 PTAS。为此,我们考虑 CSP 的一种鲁棒性质;称一个实例是稳定的,是指存在唯一最优解 xx^* 且对任意其他解 xx',未满足子句的数量与 xx^*xx' 间的汉明距离成比例。Dinur 等人已证明稳定 QSAT 对某些常数 Q 难以近似,我们的假设仅是带界变量出现次数的稳定 QSAT 同样困难。在此假设下,我们考虑“保持稳定性”的归约来证明稳定 k-Means 的困难性。此类归约似乎比标准 L-归约更脆弱,并可能进一步用于证明其他稳定优化问题的困难性。

关键词

引用

@article{arxiv.1807.05443,
  title  = {Exact Algorithms and Lower Bounds for Stable Instances of Euclidean k-Means},
  author = {Zachary Friggstad and Kamyar Khodamoradi and Mohammad R. Salavatipour},
  journal= {arXiv preprint arXiv:1807.05443},
  year   = {2024}
}

备注

28 pages, 2 figures