坏字符:不可感知的 NLP 攻击
计算与语言
2021-12-14 v2 密码学与安全
机器学习
摘要
多年的研究表明,机器学习系统无论在理论上还是实践中都易受对抗样本攻击。迄今,此类攻击主要针对视觉模型,利用人类与机器感知之间的差距。尽管基于文本的模型也曾遭受对抗样本攻击,但这类攻击难以保持语义含义与不可区分性。本文中,我们探索一类可用于黑盒环境下攻击基于文本模型的对抗样本,且不对输入做任何人类可感知的视觉修改。我们利用人类肉眼不可感知的编码特定扰动来操纵从神经机器翻译流水线到网络搜索引擎的广泛自然语言处理(NLP)系统的输出。我们发现,通过单次不可感知的编码注入——表示一个不可见字符、同形字、重排序或删除——攻击者即可显著降低脆弱模型的性能,而三次注入则可使多数模型在功能上失效。我们的攻击针对当前部署的商业系统生效,包括微软和谷歌开发的系统,以及 Facebook、IBM 和 HuggingFace 发布的开源模型。这一系列新颖攻击对许多语言处理系统构成重大威胁:攻击者可在不对底层模型做任何假设的情况下有针对性地影响系统。我们得出结论,基于文本的 NLP 系统如同传统应用一样需要谨慎的输入净化,且鉴于此类系统正被快速大规模部署,架构师与运营者亟需关注。
引用
@article{arxiv.2106.09898,
title = {Bad Characters: Imperceptible NLP Attacks},
author = {Nicholas Boucher and Ilia Shumailov and Ross Anderson and Nicolas Papernot},
journal= {arXiv preprint arXiv:2106.09898},
year = {2021}
}
备注
To appear in the 43rd IEEE Symposium on Security and Privacy. Revisions: NER & sentiment analysis experiments, previous work comparison, defense evaluation