中文

Seq2Sick:利用对抗样本评估序列到序列模型的鲁棒性

机器学习 2020-04-22 v3

摘要

构造对抗样本已成为评估深度神经网络(DNNs)鲁棒性的重要技术。然而,现有工作大多聚焦于攻击图像分类问题,因其输入空间连续且输出空间有限。本文研究更具挑战性的序列到序列(seq2seq)模型对抗样本构造问题,其输入为离散文本字符串,输出可能性几乎无限。为应对离散输入空间带来的挑战,我们提出一种结合组lasso与梯度正则化的投影梯度方法。为处理几乎无限的输出空间,我们设计了一些新颖的损失函数以实施非重叠攻击与定向关键词攻击。我们将算法应用于机器翻译与文本摘要任务,并验证了所提算法的有效性:通过改动少于3个词,我们能使seq2seq模型以高成功率产生期望输出。另一方面,我们认识到,与经过充分评估的基于CNN的分类器相比,seq2seq模型对对抗攻击本质上更具鲁棒性。

关键词

引用

@article{arxiv.1803.01128,
  title  = {Seq2Sick: Evaluating the Robustness of Sequence-to-Sequence Models with Adversarial Examples},
  author = {Minhao Cheng and Jinfeng Yi and Pin-Yu Chen and Huan Zhang and Cho-Jui Hsieh},
  journal= {arXiv preprint arXiv:1803.01128},
  year   = {2020}
}