核方法突破上限:高效处理数十亿数据点
机器学习
2020-11-30 v2 机器学习
摘要
核方法为非参数学习提供了一种优雅且有原则的方法,但由于朴素实现随数据规模扩展性较差,迄今为止很难用于大规模问题。最近的进展展示了诸多算法思想的优势,例如结合优化、数值线性代数和随机投影。在此,我们进一步推进这些努力,开发并测试了一个充分利用GPU硬件的求解器。为此,我们为核方法设计了一个预条件梯度求解器,利用了GPU加速和多GPU并行化,并实现了常见线性代数操作的核外变体以保证最佳的硬件利用率。此外,我们优化了不同操作的数值精度,并最大化了矩阵向量乘法的效率。结果表明,我们可以在包含数十亿数据点的数据集上实现实验性的显著加速,同时保证SOTA性能。此外,我们将软件作为一个易于使用的库公开提供。
引用
@article{arxiv.2006.10350,
title = {Kernel methods through the roof: handling billions of points efficiently},
author = {Giacomo Meanti and Luigi Carratino and Lorenzo Rosasco and Alessandro Rudi},
journal= {arXiv preprint arXiv:2006.10350},
year = {2020}
}
备注
33 pages, 7 figures, NeurIPS 2020