一种受几何启发的攻击方法用于生成自然语言对抗样本
计算与语言
2020-10-06 v1
摘要
生成自然语言的对抗样本是困难的,因为自然语言由离散符号组成,且样本长度常常可变。在本文中,我们提出一种受几何启发的攻击方法用于生成自然语言对抗样本。我们的攻击通过迭代逼近深度神经网络(DNNs)的决策边界来生成对抗样本。在两个数据集上使用两种不同模型的实验表明,我们的攻击以高成功率欺骗了自然语言模型,同时仅替换了少量词。人工评估显示,我们的攻击生成的对抗样本人类难以识别。进一步的实验表明,对抗训练可以提升模型针对我们攻击的鲁棒性。
引用
@article{arxiv.2010.01345,
title = {A Geometry-Inspired Attack for Generating Natural Language Adversarial Examples},
author = {Zhao Meng and Roger Wattenhofer},
journal= {arXiv preprint arXiv:2010.01345},
year = {2020}
}
备注
COLING 2020 Long Paper