中文

基于梯度的对抗攻击:通过遍历嵌入空间攻击类别序列模型

机器学习 2020-10-13 v3 机器学习

摘要

深度学习模型遭受一种称为对抗攻击的现象:我们可以对模型输入施加微小改动,从而针对特定样本欺骗分类器。文献主要考虑针对图像及其他结构化输入模型的对抗攻击。然而,针对类别序列的对抗攻击同样可能具有危害性。针对类别序列形式输入的成功的攻击应解决以下挑战:(1) 目标函数的不可微性,(2) 对初始序列变换的约束,以及 (3) 可能问题的多样性。我们利用两种黑盒对抗攻击来处理这些挑战。第一种方法采用蒙特卡洛方法,可在任何场景下使用;第二种方法使用模型与目标度量的连续松弛,从而只需极少额外代价即可使用最先进的对抗攻击方法。针对资金交易、医疗欺诈及 NLP 数据集的结果表明,所提方法生成的合理对抗序列接近于原始序列,但能欺骗机器学习模型。

关键词

引用

@article{arxiv.2003.04173,
  title  = {Gradient-based adversarial attacks on categorical sequence models via traversing an embedded world},
  author = {Ivan Fursov and Alexey Zaytsev and Nikita Kluchnikov and Andrey Kravchenko and Evgeny Burnaev},
  journal= {arXiv preprint arXiv:2003.04173},
  year   = {2020}
}