中文

阿达马响应:隐私、高效且低通信开销的分布估计

机器学习 2018-06-29 v2 数据结构与算法 信息论 math.IT

摘要

我们研究在 ε\varepsilon-局部差分隐私下估计 kk 元分布的问题。nn 个样本分布于用户之中,用户将其样本的隐私化版本发送至中心服务器。所有先前已知的样本最优算法在高隐私机制 (ε=O(1))(\varepsilon=O(1)) 下需要每个用户线性(关于 kk)的通信,且运行时间随 nkn\cdot k 增长,这对于大域大小 kk 而言可能难以承受。我们提出阿达马响应(Hadamard Response, HR),一种无需共享随机性且对用户对称的局部隐私化方案。我们的方案对所有 ε\varepsilon 具有阶最优的样本复杂度,每用户至多 logk+2\log k+2 比特的通信,以及 O~(n+k)\tilde{O}(n + k) 的近线性运行时间。我们的编码与解码基于阿达马矩阵,且易于实现。统计性能依赖于阿达马矩阵的编码理论特性,即各行间的大汉明距离。利用快速 Walsh–Hadamard 变换对算法的高效实现带来了计算增益。我们在理论与实验上将该方法与随机响应(Randomized Response, RR)、RAPPOR 及子集选择机制(Subset-selection, SS)进行比较。对于 k=10000k=10000,我们的算法比 SS 和 RAPPOR 快约 100 倍。

关键词

引用

@article{arxiv.1802.04705,
  title  = {Hadamard Response: Estimating Distributions Privately, Efficiently, and with Little Communication},
  author = {Jayadev Acharya and Ziteng Sun and Huanyu Zhang},
  journal= {arXiv preprint arXiv:1802.04705},
  year   = {2018}
}