中文

CountSketch、特征哈希与三中位数

数据结构与算法 2021-02-04 v1 机器学习 机器学习

摘要

在本文中,我们重新审视经典的 CountSketch 方法,它是一种稀疏随机投影,将(高维)欧氏向量 vv 变换为维度 (2t1)s(2t-1) s 的向量,其中 t,s>0t, s > 0 为整数参数。已知即便对于 t=1t=1,CountSketch 也能以不超过 v22/s\|v\|_2^2/s 的方差估计 vv 的坐标。对于 t>1t > 1,估计量取 2t12t-1 个独立估计的中位数,且估计偏差超过 2v2/s2 \|v\|_2/\sqrt{s} 的概率随 tt 呈指数级小。这暗示应将 tt 选为所需逆失败概率的对数级别。然而,CountSketch 的实现常使用较小的常数 tt。先前工作仅预测此设定下常数因子的改进。我们的主要贡献是对 CountSketch 的新分析,表明当 t>1t > 1 时方差改进为 O(min{v12/s2,v22/s})O(\min\{\|v\|_1^2/s^2,\|v\|_2^2/s\})。即对于足够大的 ss,方差渐近地随 s2s^{-2} 递减。我们还研究了需从两个 CountSketch 估计内积时的方差设定。该发现表明,Feature Hashing 方法(本质上与 CountSketch 相同但不使用中位数估计量)在可使用中位数估计量的设定下,能以较小代价变得更为可靠。我们在实验中证实了理论发现,从而有助于解释为何实践中常只需较小的常数个估计。我们改进的方差界基于关于独立同分布随机变量中位数的方差与高阶矩的新通用定理,这些定理本身可能具有独立意义。

关键词

引用

@article{arxiv.2102.02193,
  title  = {CountSketches, Feature Hashing and the Median of Three},
  author = {Kasper Green Larsen and Rasmus Pagh and Jakub Tětek},
  journal= {arXiv preprint arXiv:2102.02193},
  year   = {2021}
}