基于行为克隆的多粒度文本对抗攻击
计算与语言
2021-09-10 v1 密码学与安全
机器学习
摘要
近年来,文本对抗攻击模型因在评估NLP模型鲁棒性方面的成功而日益流行。然而,现有工作存在明显不足。(1) 它们通常只考虑单一粒度的修改策略(如词级或句级),不足以探索整体的文本空间进行生成;(2) 它们需要查询受害模型数百次才能成功攻击,在实际中效率极低。为了解决这些问题,本文我们提出了 MAYA,一种多粒度攻击模型,能够以更少的受害模型查询次数有效生成高质量的对抗样本。此外,我们提出了一种基于强化学习的方法,利用来自 MAYA 算法的专家知识,通过行为克隆训练多粒度攻击智能体,以进一步减少查询次数。此外,我们还使该智能体适应于仅输出标签而不输出置信度分数的黑盒模型攻击。我们通过在两种不同的黑盒攻击设置和三个基准数据集上攻击 BiLSTM、BERT 和 RoBERTa,进行了全面的实验来评估我们的攻击模型。实验结果表明,与基线模型相比,我们的模型实现了整体更好的攻击性能,并产生了更流畅、语法更正确的对抗样本。此外,我们的对抗攻击智能体在两种攻击设置中都显著减少了查询次数。我们的代码已在 https://github.com/Yangyi-Chen/MAYA 发布。
引用
@article{arxiv.2109.04367,
title = {Multi-granularity Textual Adversarial Attack with Behavior Cloning},
author = {Yangyi Chen and Jin Su and Wei Wei},
journal= {arXiv preprint arXiv:2109.04367},
year = {2021}
}
备注
Accepted by the main conference of EMNLP 2021