中文

面向大规模学习的哈希算法

机器学习 2011-06-07 v1 机器学习

摘要

本文首先证明,b-bit 最小哈希(其估计量为正定核)可以自然地与 SVM 和逻辑回归等学习算法相结合。我们采用一种简单的方案,将非线性(相似度)核转换为线性(内积)核;因此,大规模问题可以极其高效地求解。我们的方法为海量且极高维数据集中的大规模学习提供了一种简单有效的解决方案,尤其是在数据无法装入内存时。然后,我们将 b-bit 最小哈希与 Vowpal Wabbit (VW) 算法(与 Count-Min (CM) 草图相关)进行了比较。有趣的是,VW 具有与随机投影相同的方差。我们的理论和实证比较表明,在二值数据上,b-bit 最小哈希通常比 VW(和随机投影)显著更准确(在相同存储量下)。此外,b-bit 最小哈希可以与 VW 结合,在训练速度方面实现进一步改进,尤其是当 b 较大时。

关键词

引用

@article{arxiv.1106.0967,
  title  = {Hashing Algorithms for Large-Scale Learning},
  author = {Ping Li and Anshumali Shrivastava and Joshua Moore and Arnd Christian Konig},
  journal= {arXiv preprint arXiv:1106.0967},
  year   = {2011}
}