BEAR:用于亚线性内存中超高维特征选择的 BFGS 算法草图化
机器学习
2021-05-27 v2
摘要
我们考虑机器学习应用中的特征选择,其中数据维度极大,超出了(本地)计算机的工作内存。遗憾的是,当前的大规模草图化算法由于草图域中随机梯度噪声的不可逆碰撞与累积,表现出较差的内存-精度权衡。此处,我们开发了称为 BEAR 的二阶超高维特征选择算法,其通过将著名的 Broyden-Fletcher-Goldfarb-Shannon(BFGS)算法中的二阶梯度存储于 Count Sketch(一种来自流数据文献的亚线性内存数据结构)中,避免了额外的碰撞。在真实数据集上的实验表明,与一阶草图化算法相比,BEAR 达到相同分类精度所需内存空间最多少三个数量级。理论分析证明了 BEAR 在草图化算法 t 次迭代中以 O(1/t) 速率收敛。我们的算法揭示了二阶优化在受内存约束的超高维数据集训练模型草图化中未被发掘的优势。
引用
@article{arxiv.2010.13829,
title = {BEAR: Sketching BFGS Algorithm for Ultra-High Dimensional Feature Selection in Sublinear Memory},
author = {Amirali Aghazadeh and Vipul Gupta and Alex DeWeese and O. Ozan Koyluoglu and Kannan Ramchandran},
journal= {arXiv preprint arXiv:2010.13829},
year = {2021}
}