像人类一样处理文本:视觉攻击与防护NLP系统
计算与语言
2020-06-11 v2 密码学与安全
计算机视觉与模式识别
机器学习
摘要
对文本的视觉修改常用于在社交媒体中混淆攻击性评论(如“!d10t”)或作为一种书写风格(如“leet speak”中的“1337”)等场景。我们将其视为NLP中一种新型对抗攻击,在此设定下人类非常鲁棒,正如我们在简单与较困难视觉输入扰动上的实验所表明的。我们进而考察视觉对抗攻击对当前NLP系统在字符级、词级与句子级任务上的影响,表明神经与非神经模型均与人类相反,对此类攻击极度敏感,性能下降高达82%。我们随后探索了三种防护方法——视觉字符嵌入、对抗训练与基于规则的恢复——它们大幅提升了模型的鲁棒性。然而,这些防护方法仍落后于非攻击场景下的性能,这表明处理视觉攻击的困难性。
引用
@article{arxiv.1903.11508,
title = {Text Processing Like Humans Do: Visually Attacking and Shielding NLP Systems},
author = {Steffen Eger and Gözde Gül Şahin and Andreas Rücklé and Ji-Ung Lee and Claudia Schulz and Mohsen Mesgar and Krishnkant Swarnkar and Edwin Simpson and Iryna Gurevych},
journal= {arXiv preprint arXiv:1903.11508},
year = {2020}
}
备注
Accepted as long paper at NAACL-2019; fixed one ungrammatical sentence