中文

采样的对抗鲁棒性

数据结构与算法 2019-06-28 v1 计算几何 密码学与安全 数据库 分布式、并行与集群计算

摘要

随机采样是现代算法、统计学和机器学习中的基本原语,作为一种获取数据的小型但“代表性”子集的通用方法。本文研究流式场景下采样对自适应对抗攻击的鲁棒性:对手从一个全集UU向采样算法(如伯努利采样或蓄水池采样)发送元素流,目标是使样本“非常不具代表性”。对手是完全自适应的,即它知道流中任意给定点样本的确切内容,并能据此在线选择下一个发送的元素。静态场景下的已知结果表明,如果完整流是预先选定的(非自适应),那么大小为Ω(d/ε2)\Omega(d / \varepsilon^2)的随机样本有较大概率成为完整数据的ε\varepsilon近似,其中dd是底层集合系统(U,R)(U,R)的VC维。这个样本量是否足以对抗自适应对手?简单的答案是\emph{否定的}:我们展示了一个集合系统,在静态场景下常数样本量(对应VC维11)即足够,但只要样本量(显著)亚线性于流长度,自适应对手就能通过一个简单且易于实施的攻击使样本非常不具代表性。然而,这种攻击“仅具理论意义”,要求集合系统的大小(本质上)是流长度的指数级。这并非巧合:我们证明,要使伯努利采样或蓄水池采样对自适应对手具有鲁棒性,唯一需要的修改是将样本量中的VC维项dd替换为势项logR\log |R|。这几乎与攻击所施加的界限相匹配。

关键词

引用

@article{arxiv.1906.11327,
  title  = {The Adversarial Robustness of Sampling},
  author = {Omri Ben-Eliezer and Eylon Yogev},
  journal= {arXiv preprint arXiv:1906.11327},
  year   = {2019}
}