DP-PCA:统计最优且差分隐私的主成分分析
机器学习
2022-05-30 v1 密码学与安全
信息论
math.IT
统计理论
机器学习
统计理论
摘要
我们研究了在 -差分隐私下,从 维的 个独立同分布数据中计算主成分这一典型统计任务。尽管已有大量文献研究,现有方案在两个关键方面存在不足:() 即使对于高斯数据,现有隐私算法要求样本数 随 超线性增长,即 ,才能取得非平凡结果,而非隐私 PCA 仅需 ;() 现有技术即使在每个数据点的随机性任意小时仍存在非零误差。我们提出 DP-PCA,这是一种单遍算法,克服了上述两个局限。它基于一种私有小批量梯度上升方法,该方法依赖于{\em 私有均值估计},通过适应给定小批量梯度的方差来添加确保隐私所需的最小噪声。对于亚高斯数据,即使 我们也给出了近乎最优的统计误差率。此外,我们给出了一个下界,表明亚高斯式假设在取得最优误差率中是必要的。
引用
@article{arxiv.2205.13709,
title = {DP-PCA: Statistically Optimal and Differentially Private PCA},
author = {Xiyang Liu and Weihao Kong and Prateek Jain and Sewoong Oh},
journal= {arXiv preprint arXiv:2205.13709},
year = {2022}
}