Range-Net: 面向大数据应用的高精度流式SVD
数值分析
2021-03-22 v6 人工智能
机器学习
数值分析
摘要
在大数据环境下,由于主存需求限制,计算主SVD因子十分困难。近期提出的流式随机SVD(randomized SVD)方案依赖于数据奇异值谱呈指数衰减这一严苛假设,而实际数据很少满足该条件。尽管这些方法因相关的尾部能量误差界而被声称可应用于科学计算,但当上述假设不成立时,其奇异向量与奇异值的近似误差很高。此外从实际角度看,过采样仍可能占用大量内存,甚至超过数据的特征维数。为解决这些问题,我们提出Range-Net作为随机SVD的替代方案,其满足Eckart-Young-Mirsky(EYM)定理给出的尾部能量下界。Range-Net是一种带随机初始化的确定性两阶段神经优化方法,其主存需求显式依赖于特征维数与期望秩,与样本维数无关。数据样本以流式方式读入,网络最小化问题收敛于期望的秩-r近似。Range-Net具有完全可解释性,所有网络输出与权重均有明确含义。我们提供了理论保证:Range-Net提取的SVD因子在机器精度下满足EYM尾部能量下界。我们在不同规模真实数据上的数值实验证实了该界。与最先进的流式随机SVD相比,Range-Net精度提升六个数量级且内存高效。
引用
@article{arxiv.2010.14226,
title = {Range-Net: A High Precision Streaming SVD for Big Data Applications},
author = {Gurpreet Singh and Soumyajit Gupta and Matthew Lease and Clint Dawson},
journal= {arXiv preprint arXiv:2010.14226},
year = {2021}
}