理解用于特征哈希的稀疏JL变换
机器学习
2020-03-27 v2 数据结构与算法
机器学习
概率论
摘要
特征哈希与其他随机投影方案常用于降低特征向量的维数。目标是在近似保持欧氏范数的同时,将位于中的高维特征向量高效投影到低得多的空间中。这些方案可使用稀疏随机投影构造,例如采用稀疏Johnson-Lindenstrauss(JL)变换。Weinberger等人(ICML '09)开创的一系列工作分析了稀疏度为1的稀疏JL在-到-范数比值较小的特征向量上的精度。最近,Freksen、Kamma和Larsen(NeurIPS '18)证明了稀疏度为1的稀疏JL在-到-范数比值与精度之间的紧权衡,闭合了该系列工作。本文中,我们展示了在特征向量上使用大于1的稀疏度的稀疏JL的益处。我们的主要结果是针对一般稀疏度的-到-范数比值与精度之间的紧权衡,显著推广了Freksen等人的结果。我们的结果从理论上证明稀疏度的稀疏JL在特征向量上可比的稀疏JL具有显著更好的范数保持性质;我们也通过实验验证了这一发现。
引用
@article{arxiv.1903.03605,
title = {Understanding Sparse JL for Feature Hashing},
author = {Meena Jagadeesan},
journal= {arXiv preprint arXiv:1903.03605},
year = {2020}
}
备注
Appeared at NeurIPS 2019; this is the full version