MaskPure:基于随机净化提高文本对抗样本防御
机器学习
2024-06-21 v1 人工智能
摘要
语言模型鲁棒性的提高,包括对对抗攻击的成功防御,仍是开放问题。在计算机视觉中,基于扩散模型的随机加噪和去噪过程被证明对净化输入图像具有帮助,从而提高模型对对抗攻击的鲁棒性。类似地,一些初始工作探索了使用随机加噪和去噪来缓解 NLP 中的对抗攻击,但提高这些方法的质量和效率是必要的,以便它们保持竞争力。我们延续了受扩散过程启发的输入文本净化方法,这些方法在分类前随机遮盖和替换输入文本的部分内容。我们提出的新方法 MaskPure 在鲁棒性方面优于或相当于其他当代防御方法,同时无需对抗分类器进行训练,也不假设了解攻击类型。此外,我们表明 MaskPure 可被证明具有可证鲁棒性。鉴于 MaskPure 是首个在字符级和词级攻击上均显示成功的随机净化方法,我们意识到其可通用性和前景。总之,MaskPure 算法连接了当前最强的可证和经验对抗防御方法的文献,表明理论和实际鲁棒性可以同时获得。代码已在 GitHub 上提供:https://github.com/hubarruby/MaskPure。
引用
@article{arxiv.2406.13066,
title = {MaskPure: Improving Defense Against Text Adversaries with Stochastic Purification},
author = {Harrison Gietz and Jugal Kalita},
journal= {arXiv preprint arXiv:2406.13066},
year = {2024}
}
备注
15 pages, 1 figure, in the proceedings of The 29th International Conference on Natural Language & Information Systems (NLDB 2024)