中文

Mischief:一种针对 Transformer 架构的简单黑盒攻击

计算与语言 2020-10-19 v1 密码学与安全 机器学习

摘要

我们提出 Mischief,一种简单轻量的方法,用于为语言模型生成一类人类可读、逼真的对抗样本。我们在四种基于 transformer 的架构上、跨多种下游任务、以及在所述样本不同浓度下对我们的算法进行了详尽实验。我们的发现表明,测试集中存在 Mischief 生成的对抗样本会显著削弱(最高达 20%20\%)这些模型相对于其报告基线的性能。尽管如此,我们也证明,通过在训练集中加入类似样本,可以恢复其在对抗测试集上的基线分数。此外,对于某些任务,使用 Mischief 集训练的模型相对于其原始非对抗基线表现出轻微的性能提升。

关键词

引用

@article{arxiv.2010.08542,
  title  = {Mischief: A Simple Black-Box Attack Against Transformer Architectures},
  author = {Adrian de Wynter},
  journal= {arXiv preprint arXiv:2010.08542},
  year   = {2020}
}

备注

Technical report