中文

FireBERT:增强基于 BERT 的分类器以抵御对抗攻击

计算与语言 2020-08-11 v1 机器学习

摘要

我们提出 FireBERT,一组三个概念验证型 NLP 分类器,通过生成原始样本的多样化替代样本,使其对 TextFooler 风格的词语扰动具有鲁棒性。在一种方法中,我们针对训练数据和合成对抗样本对 BERT 进行协同微调。在第二种方法中,我们在评估时通过词语替换和嵌入向量扰动生成合成样本。然后将多样化评估结果通过投票组合。第三种方法在评估时用嵌入向量扰动替代词语替换。我们在 MNLI 和 IMDB Movie Review 数据集上评估 FireBERT,包括原始样本以及由 TextFooler 生成的对抗样本。我们还测试与作用于未加固的分类器相比,TextFooler 在操纵 FireBERT 时是否更不易成功创建新的对抗样本。我们表明,在面对对抗攻击时,有可能提高基于 BERT 的模型的准确率,同时不显著降低常规基准样本的准确率。我们提出使用合成数据生成器进行协同微调,作为一种高效方法,可抵御 95% 的预制对抗样本,同时保持 98% 的原始基准性能。我们还展示评估时扰动作为进一步研究的有前景方向,可将预制对抗样本的准确率恢复至基准性能的 75%,并在 TextFooler 主动攻击下恢复至 65%(基线为原始 75% / 攻击 12%)。

关键词

引用

@article{arxiv.2008.04203,
  title  = {FireBERT: Hardening BERT-based classifiers against adversarial attack},
  author = {Gunnar Mein and Kevin Hartman and Andrew Morris},
  journal= {arXiv preprint arXiv:2008.04203},
  year   = {2020}
}

备注

8 pages, 10 figures, code available at: https://github.com/FireBERT-author/FireBERT