保持语义的对抗性文本攻击
计算与语言
2023-03-06 v2 机器学习
摘要
深度神经网络(DNNs)已知易受对抗图像的影响,而其在文本分类中的鲁棒性却鲜有研究。文献中已提出数类文本攻击方法,包括字符级、词级和句子级攻击。然而,在最小化诱导误分类所需的词语改动数量的同时,确保词汇正确性、句法合理性和语义相似性,仍是一项挑战。本文提出一种基于双词与单词的自适应语义保持优化(BU-SPO)方法来检验深度模型的脆弱性。我们的方法具有四大优点。首先,我们提出不仅在单词词级而且在双词级攻击文本文档,后者能更好地保持语义并避免产生无意义输出。其次,我们提出一种混合方法,将输入词替换为其同义词候选与义素候选中的选项,相较于仅使用同义词大大丰富了潜在替换。第三,我们设计了一种优化算法,即语义保持优化(SPO),以确定词语替换的优先级,旨在降低修改代价。最后,我们进一步用语义滤波器(称为SPOF)改进SPO,以寻找具有最高语义相似度的对抗样本。我们在IMDB、AG's News和Yahoo! Answers文本数据集上通过攻击四种流行的DNNs模型来评估BU-SPO与BU-SPOF的有效性。结果表明,与现有方法相比,我们的方法以最少的词语改动实现了最高的攻击成功率与语义保持率。
引用
@article{arxiv.2108.10015,
title = {Semantic-Preserving Adversarial Text Attacks},
author = {Xinghao Yang and Weifeng Liu and James Bailey and Dacheng Tao and Wei Liu},
journal= {arXiv preprint arXiv:2108.10015},
year = {2023}
}
备注
12 pages, 3 figures, 10 tables