白盒到黑盒:黑盒对抗攻击的高效蒸馏
机器学习
2019-04-05 v1 密码学与安全
机器学习
摘要
对抗样本对于理解神经模型的行为十分重要,并可通过对抗训练提升其鲁棒性。自然语言处理近期的工作通过假设对受攻击模型有白盒访问权限,并直接针对模型优化输入来生成对抗样本(Ebrahimi et al., 2018)。在本工作中,我们表明该优化过程中隐含的知识可被蒸馏到另一个更高效的神经网络中。我们训练一个模型来模拟白盒攻击的行为,并展示其在样本间具有良好的泛化能力。此外,它将对抗样本生成时间减少了 19 到 39 倍。我们还展示了我们的方法可迁移到黑盒设定,通过攻击 Google Perspective API 并暴露其脆弱性。我们的攻击在 42% 的生成样本中翻转了 API 预测的标签,而人类在预测真实标签时保持高准确率。
引用
@article{arxiv.1904.02405,
title = {White-to-Black: Efficient Distillation of Black-Box Adversarial Attacks},
author = {Yotam Gil and Yoav Chai and Or Gorodissky and Jonathan Berant},
journal= {arXiv preprint arXiv:1904.02405},
year = {2019}
}
备注
Accepted to NAACL-HLT 2019 as conference paper