中文

MPAT:构建抵御文本对抗攻击的鲁棒深度神经网络

机器学习 2024-03-01 v1 计算与语言 密码学与安全

摘要

深度神经网络已被证明易受对抗样本的影响,针对自然语言处理任务的对抗攻击已提出了多种防御方法。然而,先前的防御方法在确保原始任务性能的同时维持有效防御方面存在局限性。在本文中,我们提出了一种基于恶意扰动的对抗训练方法(MPAT),用于构建抵御文本对抗攻击的鲁棒深度神经网络。具体而言,我们构建了一种多级恶意样本生成策略,以生成带有恶意扰动的对抗样本,并将其替代原始输入用于模型训练。此外,我们采用了一种新颖的训练目标函数,以确保在不损害原始任务性能的前提下实现防御目标。我们通过在三个基准数据集上攻击五个受害模型,进行了全面的实验以评估我们的防御方法。结果表明,与先前的防御方法相比,我们的方法在抵御恶意对抗攻击方面更为有效,同时保持或进一步提高了原始任务的性能。

关键词

引用

@article{arxiv.2402.18792,
  title  = {MPAT: Building Robust Deep Neural Networks against Textual Adversarial Attacks},
  author = {Fangyuan Zhang and Huichi Zhou and Shuangjiao Li and Hongtao Wang},
  journal= {arXiv preprint arXiv:2402.18792},
  year   = {2024}
}