最佳防御即有效进攻:通过预测略微错误的标签抵御黑盒攻击
机器学习
2017-11-16 v1 密码学与安全
摘要
机器学习模型的黑盒攻击发生在攻击者尽管无法访问模型内部机制,却能通过模型窃取成功构造攻击之时。攻击者将训练一个模仿被攻击模型的自有替代模型。该替代模型随后可用于针对原始模型设计攻击,例如通过对抗样本。我们站在防御者立场,提出一种可通过发起反制攻击来成功避免模型窃取的方法。具体而言,对于任意传入查询,我们以使替代训练不可行的方式轻微扰动我们的输出标签分布。我们证明该扰动不影响模型的正常使用,但能针对基于模型窃取的攻击形成有效防御。
引用
@article{arxiv.1711.05475,
title = {The best defense is a good offense: Countering black box attacks by predicting slightly wrong labels},
author = {Yannic Kilcher and Thomas Hofmann},
journal= {arXiv preprint arXiv:1711.05475},
year = {2017}
}