中文

AdvExpander:通过扩展文本生成自然语言对抗样本

计算与语言 2020-12-21 v1

摘要

对抗样本对于揭示机器学习模型的脆弱性至关重要。尽管最流行的基于替换的方法(替换原始样本中的某些字符或词)取得了成功,但仅替换不足以暴露模型所有鲁棒性问题。本文提出 AdvExpander,一种通过扩展文本来构造新对抗样本的方法,其是对先前基于替换方法的补充。我们首先利用语言规则确定扩展哪些成分以及用何种类型的修饰语进行扩展。然后,通过插入从基于 CVAE 的生成模型中搜索得到的对抗性修饰语来扩展每个成分,该生成模型在大规模语料上进行了预训练。为搜索对抗性修饰语,我们直接在潜空间中搜索对抗性潜码,而无需调整预训练参数。为确保我们的对抗样本在文本匹配任务中保持标签不变,我们还用启发式规则对修改进行约束。在三个分类任务上的实验验证了 AdvExpander 的有效性及我们对抗样本的合法性。AdvExpander 通过文本扩展构造了一种新型对抗样本,从而有望揭示新的鲁棒性问题。

关键词

引用

@article{arxiv.2012.10235,
  title  = {AdvExpander: Generating Natural Language Adversarial Examples by Expanding Text},
  author = {Zhihong Shao and Zitao Liu and Jiyong Zhang and Zhongqin Wu and Minlie Huang},
  journal= {arXiv preprint arXiv:2012.10235},
  year   = {2020}
}

备注

Work in progress