面向分布式大规模稀疏逆协方差估计的避通信优化方法
机器学习
2022-02-04 v2 分布式、并行与集群计算
机器学习
摘要
在众多科学领域中,稀疏逆协方差估计是捕捉多变量数据底层依赖关系的常用工具。遗憾的是,大多数估计器可扩展性不足,无法处理现代高维数据集的规模(通常达太字节量级),且假定样本服从高斯分布。为弥补这些不足,我们提出 HP-CONCORD,一种基于正则化伪似然框架、且不假定高斯性的高度可扩展的稀疏逆协方差矩阵估计优化方法。我们的并行近端梯度方法采用一种新颖的避通信线性代数算法,可在多达 1k 节点(24k 核)的多节点集群上运行,在参数规模高达约 8190 亿(128 万维)的问题上实现并行可扩展性;即使在单节点上,HP-CONCORD 也展现出可扩展性,优于一种最先进的方法。我们还使用 HP-CONCORD 从 fMRI 数据估计大脑的底层依赖结构,并利用该结果自动识别功能区域。结果显示与神经科学文献中的聚类结果具有良好一致性。
引用
@article{arxiv.1710.10769,
title = {Communication-Avoiding Optimization Methods for Distributed Massive-Scale Sparse Inverse Covariance Estimation},
author = {Penporn Koanantakool and Alnur Ali and Ariful Azad and Aydin Buluc and Dmitriy Morozov and Leonid Oliker and Katherine Yelick and Sang-Yun Oh},
journal= {arXiv preprint arXiv:1710.10769},
year = {2022}
}
备注
Main paper: 15 pages, appendix: 24 pages