中文

基于 Dirichlet 邻域集成的 NLP 对抗攻击防御

计算与语言 2020-06-23 v1 机器学习

摘要

尽管神经网络在许多自然语言处理(NLP)任务上取得了卓越性能,它们仍易受对抗样本的攻击。在本文中,我们提出 Dirichlet 邻域集成(DNE),一种用于训练鲁棒模型以防御基于替换的攻击的随机平滑方法。在训练期间,DNE 通过从由词及其同义词张成的凸包中采样嵌入向量,为输入句子中的每个词形成虚拟句子,并将其与训练数据增强。以此方式,模型对对抗攻击具有鲁棒性,同时在原始干净数据上保持性能。DNE 与网络架构无关,并可扩展到 NLP 应用的大型模型。我们通过大量实验证明,我们的方法在不同网络架构和多个数据集上始终以显著优势超越近期提出的防御方法。

关键词

引用

@article{arxiv.2006.11627,
  title  = {Defense against Adversarial Attacks in NLP via Dirichlet Neighborhood Ensemble},
  author = {Yi Zhou and Xiaoqing Zheng and Cho-Jui Hsieh and Kai-wei Chang and Xuanjing Huang},
  journal= {arXiv preprint arXiv:2006.11627},
  year   = {2020}
}