中文

在自适应数据分析中将噪声校准至方差

机器学习 2018-06-13 v2 密码学与安全 数据结构与算法 信息论 math.IT

摘要

数据集常被多次使用,且每次后续分析可能依赖于先前分析的结果。确保泛化性与统计有效性的标准技术并未考虑这种自适应依赖性。近期一系列工作通过考察“查询”数据分布序列的问题来研究此类自适应数据复用所带来的挑战,其中每个查询可任意依赖于先前查询的答案。针对该问题所获最强结果依赖于差分隐私——一种强算法稳定性概念,具有重要性质:在数据被复用时能良好地“组合”。然而该概念相当严格,因其要求在任何任意数据元素被替换下均保持稳定。最简单的算法是添加高斯(或拉普拉斯)噪声以扭曲经验答案。但是,使用差分隐私分析该技术时,在查询方差较低的情况下会得到次优的精度保证。本文提出一种同样可自适应组合的放宽稳定性概念。我们证明,一种基于添加按查询标准差缩放噪声的简单自然算法可满足我们的稳定性概念。这意味着一种能够以显著改善的低方差查询精度保证来回答数据集统计查询的算法。此前唯一提供此类精度保证的方法基于更复杂的差分隐私均值中位数算法,其分析利用了算法更强的“组”稳定性。

关键词

引用

@article{arxiv.1712.07196,
  title  = {Calibrating Noise to Variance in Adaptive Data Analysis},
  author = {Vitaly Feldman and Thomas Steinke},
  journal= {arXiv preprint arXiv:1712.07196},
  year   = {2018}
}

备注

Accepted for presentation at Conference on Learning Theory (COLT) 2018