中文

理解用于特征哈希的稀疏JL变换

机器学习 2020-03-27 v2 数据结构与算法 机器学习 概率论

摘要

特征哈希与其他随机投影方案常用于降低特征向量的维数。目标是在近似保持欧氏范数的同时,将位于Rn\mathbb{R}^n中的高维特征向量高效投影到低得多的空间Rm\mathbb{R}^m中。这些方案可使用稀疏随机投影构造,例如采用稀疏Johnson-Lindenstrauss(JL)变换。Weinberger等人(ICML '09)开创的一系列工作分析了稀疏度为1的稀疏JL在\ell_\infty-到-2\ell_2范数比值较小的特征向量上的精度。最近,Freksen、Kamma和Larsen(NeurIPS '18)证明了稀疏度为1的稀疏JL在\ell_\infty-到-2\ell_2范数比值与精度之间的紧权衡,闭合了该系列工作。本文中,我们展示了在特征向量上使用大于1的稀疏度ss的稀疏JL的益处。我们的主要结果是针对一般稀疏度ss\ell_\infty-到-2\ell_2范数比值与精度之间的紧权衡,显著推广了Freksen等人的结果。我们的结果从理论上证明稀疏度s>1s > 1的稀疏JL在特征向量上可比s=1s = 1的稀疏JL具有显著更好的范数保持性质;我们也通过实验验证了这一发现。

关键词

引用

@article{arxiv.1903.03605,
  title  = {Understanding Sparse JL for Feature Hashing},
  author = {Meena Jagadeesan},
  journal= {arXiv preprint arXiv:1903.03605},
  year   = {2020}
}

备注

Appeared at NeurIPS 2019; this is the full version