十亿级数据上实用的无损联邦奇异值分解
分布式、并行与集群计算
2022-07-05 v3 密码学与安全
摘要
随着 GDPR 等隐私保护法规的颁布,联邦 SVD 被提出以在不同数据源上实现基于 SVD 的应用而不泄露原始数据。然而,许多基于 SVD 的应用无法被现有联邦 SVD 方案很好地支持。其关键在于,这些采用差分隐私(DP)或同态加密(HE)的方案分别受到不可去除噪声导致的精度损失或数据膨胀导致的效率下降的困扰。在本文中,我们提出了 FedSVD,一种面向十亿级数据的实用无损联邦 SVD 方法,可同时实现无损精度与高效率。FedSVD 的核心是为 SVD 精心设计的无损矩阵掩码方案:1)在采用掩码保护隐私数据的同时,FedSVD 将其从 SVD 最终结果中完全去除以实现无损精度;2)由于掩码不膨胀数据,FedSVD 在分解过程中避免了额外的计算和通信开销,从而保持高效率。使用真实世界数据集的实验表明,在 SVD 任务上 FedSVD 比基于 HE 的方法快超过 10000 倍,且误差比基于 DP 的方案小 10 个数量级。我们进一步在三个真实世界应用上构建并评估了 FedSVD:主成分分析(PCA)、线性回归(LR)和潜在语义分析(LSA),以展示其在实际中的优越性能。在联邦 LR 任务上,与两种最先进方案 FATE 和 SecureML 相比,FedSVD-LR 比 SecureML 快 100 倍,比 FATE 快 10 倍。
引用
@article{arxiv.2105.08925,
title = {Practical Lossless Federated Singular Vector Decomposition over Billion-Scale Data},
author = {Di Chai and Leye Wang and Junxue Zhang and Liu Yang and Shuowei Cai and Kai Chen and Qiang Yang},
journal= {arXiv preprint arXiv:2105.08925},
year = {2022}
}
备注
10 pages