中文

面向高速率流式主成分分析的分布式随机算法

机器学习 2020-01-07 v1 计算机视觉与模式识别 信号处理 最优化与控制 机器学习

摘要

本文考虑了在流式设置下从独立同分布数据样本中估计协方差矩阵主特征向量的问题。许多当代应用中的数据流式速率可能高到单个处理器在新样本到达之前无法完成现有特征向量估计方法的一次迭代。本文 formulation 并分析了经典 Krasulina 方法的一种分布式变体(D-Krasulina),其通过跨多个处理节点分配计算负载来跟上数据的高速流式速率。分析表明——在适当条件下——D-Krasulina 以阶最优的方式收敛到主特征向量;即,在所有节点接收到 MM 个样本后,其估计误差可为 O(1/M)O(1/M)。为降低网络通信开销,本文还开发并分析了 D-Krasulina 的小批量扩展,称为 DM-Krasulina。对 DM-Krasulina 的分析表明,在适当条件下它也能达到阶最优估计误差率,即使由于通信延迟一些样本不得不在网络内被丢弃。最后,在合成与真实世界数据上进行了实验,以验证 D-Krasulina 和 DM-Krasulina 在高速率流式设置下的收敛行为。

关键词

引用

@article{arxiv.2001.01017,
  title  = {Distributed Stochastic Algorithms for High-rate Streaming Principal Component Analysis},
  author = {Haroon Raja and Waheed U. Bajwa},
  journal= {arXiv preprint arXiv:2001.01017},
  year   = {2020}
}

备注

37 pages, 11 figures; preprint of a journal submission