中文

符号完整随机投影

统计方法学 2018-05-03 v1 信息检索 机器学习

摘要

1-bit(“符号-符号”)随机投影方法已成为大型数据集高效搜索与机器学习的常用工具。给定两个 DD 维数据向量 uu, vRDv\in\mathbb{R}^D,可生成 x=i=1Duirix = \sum_{i=1}^D u_i r_iy=i=1Dviriy = \sum_{i=1}^D v_i r_i,其中 riN(0,1)r_i\sim N(0,1) 独立同分布。“碰撞概率”为 Pr(sgn(x)=sgn(y))=1cos1ρπ{Pr}\left(sgn(x)=sgn(y)\right) = 1-\frac{\cos^{-1}\rho}{\pi},其中 ρ=ρ(u,v)\rho = \rho(u,v) 为余弦相似度。我们通过从(例如)期望 E(sgn(x)y)=2πρE(sgn(x)y)=\sqrt{\frac{2}{\pi}} \rho 估计 ρ\rho 来发展“符号完整”随机投影,并通过归一化 yy 可进一步大幅改进。对于非负数据,我们推荐一个基于 E(y1x0+y+1x<0)E\left(y_- 1_{x\geq 0} + y_+ 1_{x<0}\right) 及其归一化版本的有趣估计量。该推荐估计量几乎匹配(计算昂贵的)最大似然估计量的精度。在高相似度(ρ1\rho\rightarrow1)下,推荐估计量的渐近方差仅为符号-符号投影估计量的 43π0.4\frac{4}{3\pi} \approx 0.4。在小的 kk 和高相似度下,改进甚至更为显著。

关键词

引用

@article{arxiv.1805.00533,
  title  = {Sign-Full Random Projections},
  author = {Ping Li},
  journal= {arXiv preprint arXiv:1805.00533},
  year   = {2018}
}