中文

Johnson-Lindenstrauss 降维方法对实用失真度量的 optimality

数据结构与算法 2022-03-17 v2 计算几何 机器学习

摘要

众所周知,Johnson-Lindenstrauss(JL)降维方法在最坏情况失真下是最优的。尽管实践中使用了许多其他方法与启发式算法,关于其性能界所知甚少。JL 方法是否对实用失真度量最优的问题最近由 BFN19(NeurIPS'19)提出。他们针对广泛的实用失真度量给出了其质量的上界,并表明在许多情况下这些确实是最佳可能的。然而,一些最重要的情形,包括平均失真这一基本情形,仍属开放问题。特别地,他们表明 JL 变换在嵌入到 kk 维欧氏空间时具有 1+ϵ1+\epsilon 平均失真,其中 k=O(1/ϵ2)k=O(1/\epsilon^2),而对于更一般的失真 qq-范数,k=O(max{1/ϵ2,q/ϵ})k = O(\max\{1/\epsilon^2,q/\epsilon\}),而紧下界仅通过归约到最坏情况对大 qq 值建立。本文我们证明,对于任意降维方法,这些界对任意 1qO(log(2ϵ2n)ϵ)1 \leq q \leq O(\frac{\log (2\epsilon^2 n)}{\epsilon})ϵ1n\epsilon \geq \frac{1}{\sqrt{n}} 均为最佳可能,其中 nn 为欧氏空间子集的大小。我们的结果意味着 JL 方法对实践中常用的各种失真度量(如 stress、energy 与相对误差)是最优的。我们证明,若这些度量中任一被 ϵ\epsilon 界定,则对任意 ϵ1n\epsilon \geq \frac{1}{\sqrt{n}}k=Ω(1/ϵ2)k=\Omega(1/\epsilon^2),与 BFN19 的上界匹配,并将其紧性结果扩展至全范围矩分析。我们的结果可能表明,JL 降维方法应在实际应用中被更多考虑,且我们提供的质量界应作为评估其他方法与启发式算法性能时的比较基准。

关键词

引用

@article{arxiv.2107.06626,
  title  = {Optimality of the Johnson-Lindenstrauss Dimensionality Reduction for Practical Measures},
  author = {Yair Bartal and Ora Nova Fandina and Kasper Green Larsen},
  journal= {arXiv preprint arXiv:2107.06626},
  year   = {2022}
}