大规模回归的在线删失及其在流式大数据中的应用
应用统计
2016-06-29 v1 机器学习
摘要
线性回归可以说是统计推断方法中最突出的,因其简单性和广泛适用性而流行。随着数据密集型应用的发展,线性回归问题的庞大规模对快速且经济高效的求解器产生了日益增长的需求。幸运的是,可以在保持一定统计推断质量且计算预算可承受的情况下,省略相当一部分所积累的数据。本文引入了以在线和数据自适应方式识别并省略“信息量较少”观测值的方法,其构建基于随机近似和数据删失的原理。开发了用于删失观测的一阶和二阶随机近似最大似然算法,以估计回归系数。还提出了在线算法,通过自适应地执行删失与估计来降低整体复杂度。这些新算法涉及简单的闭式更新,并具有可证明的(非)渐近收敛保证。此外,研究了用于调谐至期望删失模式和降维水平的具体规则。在真实和合成数据集上的模拟测试证实了所提出的数据自适应方法相较于数据无关的基于随机投影的替代方法的有效性。
引用
@article{arxiv.1507.07536,
title = {Online Censoring for Large-Scale Regressions with Application to Streaming Big Data},
author = {Dimitris Berberidis and Vassilis Kekatos and Georgios B. Giannakis},
journal= {arXiv preprint arXiv:1507.07536},
year = {2016}
}