中文

数据与类别重叠未知下的对抗迁移攻击

机器学习 2021-09-28 v2 密码学与安全 计算机视觉与模式识别

摘要

将对抗攻击从一模型(替代模型)迁移至另一模型(受害模型)的能力一直是机器学习(ML)界关注的问题。成功规避未见模型的能力代表着实施攻击的不寻常的轻易程度。本工作中我们注意到,现有研究中当前的迁移攻击研究为攻击者提供了不切实际的优势:攻击者拥有与受害者完全相同的训练数据。我们首次在无需查询受害模型的不完美设定下,聚焦于攻击者与受害者可用数据的迁移对抗攻击研究,其中各模型所用确切数据或所学类别存在某种可变程度的重叠。该威胁模型与医学、恶意软件等应用相关。在此新威胁模型下,攻击成功率与数据或类别重叠并不如预期般相关,且随数据集变化。这使得攻击者与防御者难以相互推断,并有助于更广泛的模型鲁棒性与安全性研究。为此,我们开发了模拟类别差异的投影梯度下降掩码版本,使攻击者能可靠估计其攻击成功率的的下界。

关键词

引用

@article{arxiv.2109.11125,
  title  = {Adversarial Transfer Attacks With Unknown Data and Class Overlap},
  author = {Luke E. Richards and André Nguyen and Ryan Capps and Steven Forsythe and Cynthia Matuszek and Edward Raff},
  journal= {arXiv preprint arXiv:2109.11125},
  year   = {2021}
}

备注

to appear in Proceedings of the 14th ACM Workshop on Artificial Intelligence and Security