中文

基于可附加子词替换针对 Transformer 的字符级白盒对抗攻击

计算与语言 2022-11-01 v1

摘要

我们提出了首个针对 transformer 模型的字符级白盒对抗攻击方法。我们方法的直觉来源于如下观察:词在输入 transformer 模型前被切分为子词,且两个相近子词之间的替换与字符修改具有类似效果。我们的方法主要包含三步。首先,采用基于梯度的方法找出句子中最脆弱的词。然后将所选词切分为子词以替换 transformer 分词器的原始分词结果。最后,利用对抗损失引导可附加子词的替换,其中引入 Gumbel-softmax 技巧以确保梯度传播。同时,我们在优化过程中引入视觉与长度约束以实现最小字符修改。在句子级与词元级任务上的大量实验表明,我们的方法在成功率与编辑距离方面均优于以往的攻击方法。此外,人工评估验证了我们的对抗样本能够保留其原始标签。

关键词

引用

@article{arxiv.2210.17004,
  title  = {Character-level White-Box Adversarial Attacks against Transformers via Attachable Subwords Substitution},
  author = {Aiwei Liu and Honghai Yu and Xuming Hu and Shu'ang Li and Li Lin and Fukun Ma and Yawen Yang and Lijie Wen},
  journal= {arXiv preprint arXiv:2210.17004},
  year   = {2022}
}

备注

13 pages, 3 figures. EMNLP 2022