使用b比特最小哈希在200GB数据上训练逻辑回归和支持向量机以及与Vowpal Wabbit (VW)的比较
机器学习
2011-08-16 v1 统计方法学
机器学习
摘要
我们生成了一个包含10^9个特征、大小为200 GB的数据集,以测试我们最新的b比特最小哈希算法,用于训练超大规模逻辑回归和支持向量机。结果证实了我们之前的工作:与VW哈希算法(其方差与随机投影相同)相比,b比特最小哈希在相同存储下显著更准确。例如,每个数据点仅使用30个哈希值,b比特最小哈希就能达到与每个数据点使用2^14个哈希值的VW相似的精度。我们证明,b比特最小哈希的预处理成本大致与数据加载时间处于同一数量级。此外,通过使用GPU,预处理成本可以降低到数据加载时间的一小部分。最小哈希已在工业界广泛使用,至少在搜索领域如此。其流行的一个原因是,可以通过(例如)通用哈希有效地模拟排列。换句话说,无需存储排列矩阵。在本文中,我们通过实验验证了这一实践,证明即使使用最简单的2-通用哈希也不会降低学习性能。
引用
@article{arxiv.1108.3072,
title = {Training Logistic Regression and SVM on 200GB Data Using b-Bit Minwise Hashing and Comparisons with Vowpal Wabbit (VW)},
author = {Ping Li and Anshumali Shrivastava and Christian Konig},
journal= {arXiv preprint arXiv:1108.3072},
year = {2011}
}