中文

对抗攻击归因:在对抗机器学习攻击中发现可归因信号

机器学习 2021-01-11 v1 密码学与安全 计算机视觉与模式识别

摘要

机器学习(ML)模型已知易受对抗样本攻击,研究者已证明即便是生产系统(如自动驾驶汽车与机器学习即服务)亦存在脆弱性。这些系统成为恶意行为者的目标,其瘫痪可造成真实的物理与经济危害。当生产 ML 系统遭受攻击时,将攻击归因至责任威胁组织是制定响应与追究攻击者责任的关键一步。我们提出如下问题:对抗扰动的输入能否归因至生成该攻击的特定方法?换言之,能否在这些攻击中发现暴露攻击算法、模型架构或所用超参数的信号?我们引入对抗攻击归因的概念,并构建一个简单的监督学习实验框架以检验发现对抗攻击中可归因信号的可行性。我们发现,在 CIFAR-10 与 MNIST 数据集上,可区分由不同攻击算法、模型与超参数生成的攻击。

关键词

引用

@article{arxiv.2101.02899,
  title  = {Adversarial Attack Attribution: Discovering Attributable Signals in Adversarial ML Attacks},
  author = {Marissa Dotter and Sherry Xie and Keith Manville and Josh Harguess and Colin Busho and Mikel Rodriguez},
  journal= {arXiv preprint arXiv:2101.02899},
  year   = {2021}
}

备注

Accepted to RSEML Workshop at AAAI 2021