中文

关于 $l_1$ 维数缩减的非线性估计器与尾部界限:基于 Cauchy 随机投影

数据结构与算法 2007-05-23 v1 信息检索 机器学习

摘要

l1l_1 空间进行维数缩减时,Cauchy 随机投影法通过将原始数据矩阵 ARn×D\mathbf{A} \in\mathbb{R}^{n\times D} 与随机矩阵 RRD×k\mathbf{R} \in\mathbb{R}^{D\times k} (kmin(n,D)k\ll\min(n,D)) 相乘(其中矩阵 R\mathbf{R} 的元素为标准 Cauchy 分布 C(0,1) 的独立同分布样本)来实现。由于不可恢复性结果,从 B=ARRn×k\mathbf{B} = \mathbf{AR} \in\mathbb{R}^{n\times k} 中无法使用线性估计器来恢复 A\mathbf{A} 中成对的 l1l_1 距离,而会产生较大误差。然而,对于数据流计算、信息检索、机器学习和数据挖掘等某些应用场景,非线性估计器仍然有用。我们提出了三种非线性估计器:偏差校正后的样本中位数估计器、偏差校正后的几何均值估计器以及偏差校正后的最大似然估计器。样本中位数估计器与几何均值估计器在 kk\to \infty 时渐近等价,但后者在小 kk 时更精确。我们为几何均值估计器推导了显式的尾部界限,并在 l1l_1 空间的维数缩减中建立了类似 Johnson-Lindenstrauss (JL) 引理的框架,该结果弱于 l2l_2 空间中经典 JL 引理的维数缩减。渐近地来看,样本中位数估计器和几何均值估计器相对于最大似然估计器 (MLE) 的效率约为 80%。我们分析了 MLE 的矩,并提出将其分布近似为逆高斯分布的方法。

关键词

引用

@article{arxiv.cs/0610155,
  title  = {Nonlinear Estimators and Tail Bounds for Dimension Reduction in $l_1$ Using Cauchy Random Projections},
  author = {Ping Li and Trevor J. Hastie and Kenneth W. Church},
  journal= {arXiv preprint arXiv:cs/0610155},
  year   = {2007}
}