中文

最佳防御即有效进攻:通过预测略微错误的标签抵御黑盒攻击

机器学习 2017-11-16 v1 密码学与安全

摘要

机器学习模型的黑盒攻击发生在攻击者尽管无法访问模型内部机制,却能通过模型窃取成功构造攻击之时。攻击者将训练一个模仿被攻击模型的自有替代模型。该替代模型随后可用于针对原始模型设计攻击,例如通过对抗样本。我们站在防御者立场,提出一种可通过发起反制攻击来成功避免模型窃取的方法。具体而言,对于任意传入查询,我们以使替代训练不可行的方式轻微扰动我们的输出标签分布。我们证明该扰动不影响模型的正常使用,但能针对基于模型窃取的攻击形成有效防御。

关键词

引用

@article{arxiv.1711.05475,
  title  = {The best defense is a good offense: Countering black box attacks by predicting slightly wrong labels},
  author = {Yannic Kilcher and Thomas Hofmann},
  journal= {arXiv preprint arXiv:1711.05475},
  year   = {2017}
}