中文

硬标签流形:查询效率在寻找流形上对抗样本中的意外优势

机器学习 2021-03-08 v1

摘要

设计对对抗样本鲁棒的深度网络仍是一个开放问题。同样,近期针对图像分类模型的零阶硬标签攻击已显示出与一阶、梯度级替代方法相当的性能。最近在梯度级设定下已表明,常规对抗样本会离开数据流形,而其流形上对应样本实为泛化误差。在本文中,我们论证零阶设定中的查询效率与对抗者穿越数据流形相关。为解释此行为,我们提出一种基于含噪流形距离预言机的信息论论证,该预言机通过对抗者的梯度估计泄露流形信息。通过流形—梯度互信息的数值实验,我们表明该行为作为有效问题维数与训练点数的函数而起作用。在真实世界数据集及使用降维的多种零阶攻击上,我们观察到相同的普适行为可产生更接近数据流形的样本。这导致流形距离度量至多减半,而与模型鲁棒性无关。我们的结果表明,考虑流形—梯度互信息因而可指导未来更好的鲁棒模型设计,并避免敏感数据流形的泄露。

关键词

引用

@article{arxiv.2103.03325,
  title  = {Hard-label Manifolds: Unexpected Advantages of Query Efficiency for Finding On-manifold Adversarial Examples},
  author = {Washington Garcia and Pin-Yu Chen and Somesh Jha and Scott Clouse and Kevin R. B. Butler},
  journal= {arXiv preprint arXiv:2103.03325},
  year   = {2021}
}

备注

Preprint