大规模联邦数据的降维:统计速率与渐近推断
统计方法学
2025-08-27 v2
摘要
鉴于联邦生态系统中大规模数据的快速增长,传统的 principal component analysis(PCA,主成分分析)常因隐私保护考量与巨大计算负担而不适用。已有算法被提出以降低计算成本,但鲜有能在分布式环境下同时处理高维与海量样本量的方法。本文中,我们提出 FAst DIstributed(FADI)PCA 方法,用于维度 与样本量 均超大规模时的联邦数据,通过沿 并行计算与沿 分布式计算同时实现。具体而言,我们利用 个 维快速草图的并行副本来沿 划分计算负担,并沿拆分样本分布式聚合结果。我们提出了一个适用于多种统计问题的通用框架,并在该框架下建立了全面的理论结果。我们表明当 时,FADI 在加速计算的同时享有与传统 PCA 相同的非渐近误差率。我们还推导了刻画 FADI 渐近分布的推断结果,并展示了随 增大而出现的相变现象。我们进行了大量模拟以实证验证理论发现,并将 FADI 应用于 1000 Genomes 数据以研究群体结构。
引用
@article{arxiv.2306.06857,
title = {Dimension Reduction for Large-Scale Federated Data: Statistical Rate and Asymptotic Inference},
author = {Shuting Shen and Junwei Lu and Xihong Lin},
journal= {arXiv preprint arXiv:2306.06857},
year = {2025}
}