从 Hero 到 Z\'eroe:低层级对抗攻击基准
计算与语言
2020-10-29 v2
摘要
对抗攻击是对机器学习分类器输入的保标签修改,旨在欺骗机器而非人类。自然语言处理(NLP)大多聚焦于诸如改写输入文本之类的高层级攻击场景。我们认为,在社交媒体等典型应用场景中,这些攻击不够真实,转而关注字符层级的低层级攻击。受人类认知能力与人类鲁棒性引导,我们提出了首个大规模低层级对抗攻击目录与基准,称之为 Z\'eroe,涵盖九种不同的攻击模式,包括视觉与语音对抗样本。我们表明,NLP 当前的主力模型 RoBERTa 在我们的攻击下失效。我们的数据集为测试未来更具类人特性的 NLP 模型的鲁棒性提供了基准。
引用
@article{arxiv.2010.05648,
title = {From Hero to Z\'eroe: A Benchmark of Low-Level Adversarial Attacks},
author = {Steffen Eger and Yannik Benz},
journal= {arXiv preprint arXiv:2010.05648},
year = {2020}
}
备注
Authors accidentally in wrong order; cannot be undone due to conference constraints. Accepted for publication at AACL 2020