中文

从 Hero 到 Z\'eroe:低层级对抗攻击基准

计算与语言 2020-10-29 v2

摘要

对抗攻击是对机器学习分类器输入的保标签修改,旨在欺骗机器而非人类。自然语言处理(NLP)大多聚焦于诸如改写输入文本之类的高层级攻击场景。我们认为,在社交媒体等典型应用场景中,这些攻击不够真实,转而关注字符层级的低层级攻击。受人类认知能力与人类鲁棒性引导,我们提出了首个大规模低层级对抗攻击目录与基准,称之为 Z\'eroe,涵盖九种不同的攻击模式,包括视觉与语音对抗样本。我们表明,NLP 当前的主力模型 RoBERTa 在我们的攻击下失效。我们的数据集为测试未来更具类人特性的 NLP 模型的鲁棒性提供了基准。

关键词

引用

@article{arxiv.2010.05648,
  title  = {From Hero to Z\'eroe: A Benchmark of Low-Level Adversarial Attacks},
  author = {Steffen Eger and Yannik Benz},
  journal= {arXiv preprint arXiv:2010.05648},
  year   = {2020}
}

备注

Authors accidentally in wrong order; cannot be undone due to conference constraints. Accepted for publication at AACL 2020