中文

通过改进的束搜索算法生成自然语言对抗样本

计算与语言 2021-10-18 v1 人工智能

摘要

近年来,文本领域的对抗攻击研究引起了广泛关注,并提出了许多具有高攻击成功率的方法。然而,这些攻击方法效率低下,因为在制作文本对抗样本时需要对目标模型进行大量查询。本文提出了一种新的攻击模型,其攻击成功率超越了基准攻击方法,但更重要的是,其攻击效率远高于基准攻击方法。通过在四个基准数据集上攻击 WordCNN、LSTM、BiLSTM 和 BERT 对该新方法进行了实证评估。例如,在 IMDB 上攻击 BERT 和 BiLSTM 时,其攻击成功率比 SOTA 方法高出 100%,但对目标模型的查询数分别仅为 SOTA 方法的 1/4 和 1/6.5。此外,进一步的实验表明,该方法对生成的对抗样本具有良好的可迁移性。

关键词

引用

@article{arxiv.2110.08036,
  title  = {Generating Natural Language Adversarial Examples through An Improved Beam Search Algorithm},
  author = {Tengfei Zhao and Zhaocheng Ge and Hanping Hu and Dingmeng Shi},
  journal= {arXiv preprint arXiv:2110.08036},
  year   = {2021}
}

备注

9 pages, 4 figures