针对文本 Transformer 的基于梯度的对抗攻击
计算与语言
2021-04-29 v1 人工智能
密码学与安全
机器学习
摘要
我们提出了首个针对 transformer 模型的通用基于梯度的攻击。我们不是搜索单个对抗样本,而是搜索由连续值矩阵参数化的对抗样本分布,从而支持基于梯度的优化。我们通过实验证明,我们的白盒攻击在多种自然语言任务上达到了最先进的攻击性能。此外,我们展示了通过从对抗分布中采样实现的一种强大的黑盒迁移攻击,可匹敌或超越现有方法,同时仅需要硬标签输出。
引用
@article{arxiv.2104.13733,
title = {Gradient-based Adversarial Attacks against Text Transformers},
author = {Chuan Guo and Alexandre Sablayrolles and Hervé Jégou and Douwe Kiela},
journal= {arXiv preprint arXiv:2104.13733},
year = {2021}
}