中文

样本最优的局部隐私假设选择及交互性的可证益处

机器学习 2026-03-05 v2 密码学与安全 信息论 机器学习 math.IT

摘要

我们研究了在局部差分隐私约束下的假设选择问题。给定一个包含 kk 个分布的类 F\mathcal{F} 和一组来自未知分布 hh 的独立同分布样本,假设选择的目标是选取一个分布 f^\hat{f},使其与 hh 的总变差距离与 F\mathcal{F} 中最佳分布与 hh 的总变差距离相当(以高概率)。我们设计了一种 ε\varepsilon-局部差分隐私(ε\varepsilon-LDP)算法,该算法使用 Θ(kα2min{ε2,1})\Theta\left(\frac{k}{\alpha^2\min \{\varepsilon^2,1\}}\right) 个样本,以保证以高概率满足 dTV(h,f^)α+9minfFdTV(h,f)d_{TV}(h,\hat{f})\leq \alpha + 9 \min_{f\in \mathcal{F}}d_{TV}(h,f)。对于 ε<1\varepsilon<1,该样本复杂度是最优的,与 Gopi 等人(2020)的下界相匹配。所有先前已知的解决该问题的算法都需要 Ω(klogkα2min{ε2,1})\Omega\left(\frac{k\log k}{\alpha^2\min \{ \varepsilon^2 ,1\} }\right) 个样本才能工作。此外,我们的结果证明了交互性在 ε\varepsilon-LDP 假设选择中的威力。即,它打破了非交互式假设选择样本复杂度已知的 Ω(klogkα2min{ε2,1})\Omega\left(\frac{k\log k}{\alpha^2\min \{ \varepsilon^2 ,1\} }\right) 下界。我们的算法仅使用 Θ(loglogk)\Theta(\log \log k) 轮交互便打破了这一障碍。为了证明我们的结果,我们为统计查询算法(Statistical Query Algorithm, SQA)定义了“关键查询”的概念,这可能具有独立的意义。非正式地说,如果一个 SQA 的成功仅依赖于其所提出的少量查询的准确性,则称该 SQA 使用了少量的关键查询。随后,我们设计了一种使用更少关键查询的 LDP 算法。

关键词

引用

@article{arxiv.2312.05645,
  title  = {Sample-Optimal Locally Private Hypothesis Selection and the Provable Benefits of Interactivity},
  author = {Alireza F. Pour and Hassan Ashtiani and Shahab Asoodeh},
  journal= {arXiv preprint arXiv:2312.05645},
  year   = {2026}
}