中文

TextFooler黑盒对抗攻击对01损失符号激活神经网络集成的准确性

机器学习 2024-02-13 v1 人工智能 密码学与安全

摘要

最近的工作展示了01损失符号激活神经网络对图像分类对抗攻击的防御能力。一个在CIFAR10数据集上攻击这些模型的公开挑战至今未被攻克。我们在本研究中提出以下问题:01损失符号激活神经网络是否难以被一个流行的黑盒文本对抗攻击程序TextFooler所欺骗?我们在四个流行的文本分类数据集上研究了这个问题:IMDB评论、Yelp评论、MR情感分类和AG新闻分类。我们发现,与sigmoid激活交叉熵和二元神经网络相比,我们的01损失符号激活网络更难被TextFooler攻击。我们还研究了一种01损失符号激活卷积神经网络,该网络具有一个专门针对符号激活网络的新型全局池化步骤。通过这种新的变体,我们看到对抗准确率显著提升,使得TextFooler对其几乎无效。我们在\url{https://github.com/zero-one-loss/wordcnn01}和\url{https://github.com/xyzacademic/mlp01example}上免费提供我们的代码。我们在此的工作表明,01损失符号激活网络可以进一步发展,以创建针对文本对抗攻击的防欺骗模型。

关键词

引用

@article{arxiv.2402.07347,
  title  = {Accuracy of TextFooler black box adversarial attacks on 01 loss sign activation neural network ensemble},
  author = {Yunzhe Xue and Usman Roshan},
  journal= {arXiv preprint arXiv:2402.07347},
  year   = {2024}
}