关于 $l_1$ 维数缩减的非线性估计器与尾部界限:基于 Cauchy 随机投影
数据结构与算法
2007-05-23 v1 信息检索
机器学习
摘要
在 空间进行维数缩减时,Cauchy 随机投影法通过将原始数据矩阵 与随机矩阵 () 相乘(其中矩阵 的元素为标准 Cauchy 分布 C(0,1) 的独立同分布样本)来实现。由于不可恢复性结果,从 中无法使用线性估计器来恢复 中成对的 距离,而会产生较大误差。然而,对于数据流计算、信息检索、机器学习和数据挖掘等某些应用场景,非线性估计器仍然有用。我们提出了三种非线性估计器:偏差校正后的样本中位数估计器、偏差校正后的几何均值估计器以及偏差校正后的最大似然估计器。样本中位数估计器与几何均值估计器在 时渐近等价,但后者在小 时更精确。我们为几何均值估计器推导了显式的尾部界限,并在 空间的维数缩减中建立了类似 Johnson-Lindenstrauss (JL) 引理的框架,该结果弱于 空间中经典 JL 引理的维数缩减。渐近地来看,样本中位数估计器和几何均值估计器相对于最大似然估计器 (MLE) 的效率约为 80%。我们分析了 MLE 的矩,并提出将其分布近似为逆高斯分布的方法。
引用
@article{arxiv.cs/0610155,
title = {Nonlinear Estimators and Tail Bounds for Dimension Reduction in $l_1$ Using Cauchy Random Projections},
author = {Ping Li and Trevor J. Hastie and Kenneth W. Church},
journal= {arXiv preprint arXiv:cs/0610155},
year = {2007}
}