基于梯度方法的对抗性文本生成
计算与语言
2018-01-26 v2 密码学与安全
机器学习
摘要
图像上的对抗样本已在文献中被广泛研究。在众多攻击方法中,基于梯度的方法既有效又易于计算。在这项工作中,我们提出一个框架,将图像上的梯度攻击方法适配到文本领域。使用梯度方法生成对抗性文本的主要困难在于:i) 输入空间是离散的,这使得难以直接在输入中累积微小噪声;ii) 对抗性文本质量的度量较为困难。我们通过在对齐嵌入空间中搜索对抗样本,然后通过最近邻搜索重建对抗性文本来解决第一个问题。对于后一个问题,我们采用词移距离(Word Mover's Distance, WMD)来量化对抗性文本的质量。通过在三个数据集(IMDB 影评、Reuters-2 和 Reuters-5 新闻专线)上的大量实验,我们表明我们的框架能够利用梯度攻击方法生成与原始文本仅差几个词的极高质量对抗性文本。在许多情况下,我们可以改动一个词就改变整段文本的标签。我们成功地将 FGM 和 DeepFool 整合到我们的框架中。此外,我们从经验上表明 WMD 与对抗性文本的质量密切相关。
引用
@article{arxiv.1801.07175,
title = {Adversarial Texts with Gradient Methods},
author = {Zhitao Gong and Wenlu Wang and Bo Li and Dawn Song and Wei-Shinn Ku},
journal= {arXiv preprint arXiv:1801.07175},
year = {2018}
}
备注
This work lacks some crucial details. After careful discussion, we decided to withdraw it temporarily and resubmit a full version afterward