中文

利用欺骗性扰动防御机器学习模型窃取攻击

机器学习 2018-12-14 v4 人工智能 密码学与安全 机器学习

摘要

如果 adversary 能够获得所选输入的输出标签,机器学习模型就容易受到简单的模型窃取攻击。为防御此类攻击,已有研究建议通过省略概率分数来限制提供给 adversary 的信息,这显著影响了所提供服务的效用。在本工作中,我们说明服务提供者如何仍能提供有用但具误导性的类别概率信息,同时显著限制攻击的成功率。我们的防御迫使 adversary 丢弃类别概率,从而需要显著更多的查询才能训练出性能相当的模型。我们在不同的对抗模型下评估了多种攻击策略、模型架构和超参数,并评估了我们的防御面对最强 adversary 时的有效性。最后,我们量化了注入类别概率中的噪声量以衡量效用的损失,例如在 CIFAR-10 上每查询增加 1.26 nats,在 MNIST 上增加 3.27。我们的评估表明,我们的防御能使窃取模型的准确率至少下降 20%,或要求多达 64 倍的查询量,同时被保护模型的准确率几乎不受影响。

关键词

引用

@article{arxiv.1806.00054,
  title  = {Defending Against Machine Learning Model Stealing Attacks Using Deceptive Perturbations},
  author = {Taesung Lee and Benjamin Edwards and Ian Molloy and Dong Su},
  journal= {arXiv preprint arXiv:1806.00054},
  year   = {2018}
}

备注

Under review for a peer review conference