中文

SemAttack:基于不同语义空间的自然文本攻击

计算与语言 2022-06-14 v3

摘要

近期研究表明,预训练语言模型(LM)易受文本对抗攻击。然而,现有攻击方法要么攻击成功率低,要么无法在指数级大的扰动空间中高效搜索。我们提出一种高效且有效的框架 SemAttack,通过构建不同的语义扰动函数来生成自然对抗文本。特别地,SemAttack 在通用语义空间上优化生成的扰动,这些空间包括拼写错误空间、知识空间(如 WordNet)、上下文语义空间(如 BERT 聚类的嵌入空间),或这些空间的组合。因此,生成的对抗文本在语义上更贴近原始输入。大量实验揭示,最先进(SOTA)的大规模 LM(如 DeBERTa-v2)与防御策略(如 FreeLB)仍易受 SemAttack 攻击。我们进一步证明 SemAttack 具有通用性,能够为不同语言(如英文和中文)生成具有高攻击成功率的自然对抗文本。人工评估也确认我们生成的对抗文本自然且几乎不影响人类表现。我们的代码已公开于 https://github.com/AI-secure/SemAttack。

关键词

引用

@article{arxiv.2205.01287,
  title  = {SemAttack: Natural Textual Attacks via Different Semantic Spaces},
  author = {Boxin Wang and Chejian Xu and Xiangyu Liu and Yu Cheng and Bo Li},
  journal= {arXiv preprint arXiv:2205.01287},
  year   = {2022}
}

备注

Published at Findings of NAACL 2022