NLP中的对抗防御与鲁棒性综述
计算与语言
2023-04-19 v4
摘要
在过去几年中,深度神经网络不足以抵御输入数据中的对抗扰动从而易受攻击已变得日益明显。多位作者已针对计算机视觉和自然语言处理(NLP)任务提出了强对抗攻击。作为回应,许多防御机制也被提出以防止这些网络失效。防御神经网络免受对抗攻击的重要性在于确保即使输入数据被扰动,模型的预测也保持不变。已提出若干针对NLP的对抗防御方法,服务于不同的NLP任务,如文本分类、命名实体识别和自然语言推理。其中一些方法不仅防御神经网络免受对抗攻击,还在训练中充当正则化机制,使模型免于过拟合。本综述旨在通过引入一种新颖的分类法,回顾过去几年提出的各种NLP对抗防御方法。该综述还强调了NLP中先进深度神经网络的脆弱性以及防御它们所涉及的挑战。
引用
@article{arxiv.2203.06414,
title = {A Survey of Adversarial Defences and Robustness in NLP},
author = {Shreya Goyal and Sumanth Doddapaneni and Mitesh M. Khapra and Balaraman Ravindran},
journal= {arXiv preprint arXiv:2203.06414},
year = {2023}
}
备注
Accepted for publication at ACM Computing Surveys