DROP:面向时间序列的降维优化
数据库
2020-08-25 v4
摘要
降维是扩展机器学习管道的关键步骤。主成分分析(PCA)是降维的标准工具,但在完整数据集上执行 PCA 的代价可能极其高昂。因此,理论研究已经探讨了在数据样本上操作的迭代式随机 PCA 方法的有效性。然而,随机 PCA 的终止条件要么执行预定次数的迭代,要么直到解收敛,这常常为端到端运行时间改善采样了过多或过少的数据点。我们展示了在通过 PCA 进行降维时如何考虑下游分析操作,从而允许随机方法在处理输入数据的小型(例如 1%)子样本后高效终止,减少整个工作负载的运行时间。利用这一点,我们提出了 DROP,一个降维优化器,与基于奇异值分解的 PCA 技术相比实现了高达 5 倍的加速,并且在端到端工作负载中超越了 FFT 和 PAA 等常规方法高达 16 倍。
引用
@article{arxiv.1708.00183,
title = {DROP: Dimensionality Reduction Optimization for Time Series},
author = {Sahaana Suri and Peter Bailis},
journal= {arXiv preprint arXiv:1708.00183},
year = {2020}
}