中文

核岭回归与核 $k$-均值聚类的紧核查询复杂度

数据结构与算法 2019-05-17 v1 机器学习

摘要

我们给出了在 nn 个输入点上近似求解核岭回归(KRR)与核 kk-均值聚类(KKMC)所需核评估次数的紧下界。对于 KRR,我们对目标函数最小化量的相对误差近似的下界为 Ω(ndeffλ/ε)\Omega(nd_{\mathrm{eff}}^\lambda/\varepsilon),其中 deffλd_{\mathrm{eff}}^\lambda 为有效统计维数,该下界在 log(deffλ/ε)\log(d_{\mathrm{eff}}^\lambda/\varepsilon) 因子内是紧的。对于 KKMC,我们对寻找达到目标函数相对误差近似的 kk-聚类的下界为 Ω(nk/ε)\Omega(nk/\varepsilon),该下界在 log(k/ε)\log(k/\varepsilon) 因子内是紧的。我们的 KRR 结果解决了 El Alaoui 与 Mahoney 一个开放问题的变体,即有效统计维数是否为采样复杂度的下界。此外,对于输入为高斯混合这一重要实际情况,我们提供了一种绕过上述下界的 KKMC 算法。

关键词

引用

@article{arxiv.1905.06394,
  title  = {Tight Kernel Query Complexity of Kernel Ridge Regression and Kernel $k$-means Clustering},
  author = {Manuel Fernandez and David P. Woodruff and Taisuke Yasuda},
  journal= {arXiv preprint arXiv:1905.06394},
  year   = {2019}
}

备注

27 pages, to appear in ICML 2019