中文

面向文本对抗攻击的上下文化扰动

计算与语言 2021-03-16 v2

摘要

对抗样本暴露了自然语言处理(NLP)模型的脆弱性,并可用于评估与提升其鲁棒性。现有生成此类样本的技术通常由与上下文无关的局部启发式规则驱动,常导致不自然且不合语法的输出。本文提出CLARE,一种上下文化对抗样本生成模型(ContextuaLized AdversaRial Example generation),通过掩码-再填充流程生成流畅且合乎语法的输出。CLARE构建于预训练掩码语言模型之上,并以上下文感知方式修改输入。我们提出三种上下文化扰动:替换、插入与合并,允许生成不同长度的输出。凭借更丰富的可用策略,CLARE能以更少的修改更有效地攻击受害模型。大量实验与人工评估表明,CLARE在攻击成功率、文本相似度、流畅度与语法性方面均优于基线方法。

关键词

引用

@article{arxiv.2009.07502,
  title  = {Contextualized Perturbation for Textual Adversarial Attack},
  author = {Dianqi Li and Yizhe Zhang and Hao Peng and Liqun Chen and Chris Brockett and Ming-Ting Sun and Bill Dolan},
  journal= {arXiv preprint arXiv:2009.07502},
  year   = {2021}
}

备注

Accepted by NAACL 2021, long paper