中文

针对文本 Transformer 的基于梯度的对抗攻击

计算与语言 2021-04-29 v1 人工智能 密码学与安全 机器学习

摘要

我们提出了首个针对 transformer 模型的通用基于梯度的攻击。我们不是搜索单个对抗样本,而是搜索由连续值矩阵参数化的对抗样本分布,从而支持基于梯度的优化。我们通过实验证明,我们的白盒攻击在多种自然语言任务上达到了最先进的攻击性能。此外,我们展示了通过从对抗分布中采样实现的一种强大的黑盒迁移攻击,可匹敌或超越现有方法,同时仅需要硬标签输出。

关键词

引用

@article{arxiv.2104.13733,
  title  = {Gradient-based Adversarial Attacks against Text Transformers},
  author = {Chuan Guo and Alexandre Sablayrolles and Hervé Jégou and Douwe Kiela},
  journal= {arXiv preprint arXiv:2104.13733},
  year   = {2021}
}