中文

作为对抗攻击防御的文本对抗净化

计算与语言 2023-05-04 v2

摘要

对抗净化是一种无需了解 incoming 攻击形式即可成功防御对抗攻击的机制。一般而言,对抗净化旨在去除对抗扰动,从而可基于恢复出的干净样本做出正确预测。尽管对抗净化在计算机视觉领域(结合能量基模型和扩散模型等生成模型)取得了成功,但将净化用作防御文本对抗攻击的策略却鲜有探索。在本工作中,我们引入一种新颖的对抗净化方法,专注于防御文本对抗攻击。借助语言模型,我们可通过掩码输入文本并基于掩码语言模型重建被掩文本来注入噪声。以此方式,我们为文本模型构建了一个针对最广泛使用的词替换对抗攻击的对抗净化过程。我们在若干强对抗攻击方法(包括 Textfooler 和 BERT-Attack)上测试了所提对抗净化方法,实验结果表明该净化算法可成功防御强词替换攻击。

关键词

引用

@article{arxiv.2203.14207,
  title  = {Text Adversarial Purification as Defense against Adversarial Attacks},
  author = {Linyang Li and Demin Song and Xipeng Qiu},
  journal= {arXiv preprint arXiv:2203.14207},
  year   = {2023}
}

备注

Accepted by ACL2023 main conference