T3:用于定向攻击的树自编码器约束对抗文本生成
计算与语言
2020-10-07 v2 机器学习
摘要
针对自然语言处理系统的对抗攻击对输入进行看似无害的修改,便可诱导目标模型产生任意错误。尽管引发了极大关注,此类对抗攻击可被用于评估NLP模型的鲁棒性。与连续数据域(如图像)中的对抗样本生成相比,生成保持原意的对抗文本具有挑战性,因为文本空间是离散且不可微的。为应对这些挑战,我们提出一个目标可控的对抗攻击框架T3,其适用于一系列NLP任务。具体而言,我们提出一种基于树的自动编码器,将离散文本数据嵌入连续表示空间,并在此之上优化对抗扰动。随后应用一种新颖的基于树的解码器来正则化生成文本的句法正确性,并在句子(T3(Sent))或词(T3(Word))级别上对其进行操控。我们考虑两种最具代表性的NLP任务:情感分析与问答(QA)。大量实验结果与人评研究表明,T3生成的对抗文本能够成功操纵NLP模型输出定向的错误答案,而不会误导人类。此外,我们展示了生成的对抗文本具有高迁移性,从而支持实际的黑盒攻击。我们的工作为检验NLP模型鲁棒性提供了一种有效且通用的途径。我们的代码公开于 https://github.com/AI-secure/T3/。
引用
@article{arxiv.1912.10375,
title = {T3: Tree-Autoencoder Constrained Adversarial Text Generation for Targeted Attack},
author = {Boxin Wang and Hengzhi Pei and Boyuan Pan and Qian Chen and Shuohang Wang and Bo Li},
journal= {arXiv preprint arXiv:1912.10375},
year = {2020}
}
备注
Accepted to EMNLP 2020 as a long paper. 17 pages, 4 figures