面向大规模核近似的随机特征数据依赖压缩
机器学习
2019-03-01 v2 机器学习
摘要
核方法提供了在当代大规模数据集中学习复杂关系的灵活性,同时享有关于质量的有力理论保证。遗憾的是,这些方法通常需要在数据集规模上呈三次方的运行时间,在大数据环境下是一笔难以承受的代价。随机特征映射(RFM)与 Nystrom 方法均将核矩阵的低秩近似视为一种潜在的解决方案。但是,为了达到理想的理论保证,前者可能需要数量大得难以承受的特征 J+,而后者对于高维问题可能昂贵得难以承受。我们提出将 RFM 的简洁性与通用性与一种数据依赖的特征选择方案相结合,以仅用 O(log J+) 个特征实现 Nystrom 的理想理论近似性质。我们的核心见解是:先从一个大规模的随机特征集合出发,再以数据依赖、计算高效的方式将其约简为少量加权特征,同时保留使用原始大规模特征集合的统计保证。我们通过理论与实验(包括在一个超过 5000 万条观测的数据集上)证明了方法的有效性。特别地,我们表明与最先进的方法相比,我们的方法以可证明更少的随机特征实现了较小的核矩阵近似误差和更好的测试集精度。
引用
@article{arxiv.1810.04249,
title = {Data-dependent compression of random features for large-scale kernel approximation},
author = {Raj Agrawal and Trevor Campbell and Jonathan H. Huggins and Tamara Broderick},
journal= {arXiv preprint arXiv:1810.04249},
year = {2019}
}
备注
24 pages, 8 figures, to appear in AISTATS 2019