BERT-ATTACK:利用 BERT 对 BERT 的对抗攻击
计算与语言
2020-10-05 v3
摘要
离散数据(如文本)的对抗攻击已被证明比连续数据(如图像)更具挑战性,因为难以用基于梯度的方法生成对抗样本。当前针对文本的成功攻击方法通常采用字符或词层面的启发式替换策略,这在保持语义一致性与语言流畅性的同时,仍难以在海量可能的替换组合空间中找到最优解。本文中,我们提出 \textbf{BERT-Attack},一种利用以 BERT 为代表的预训练掩码语言模型生成高质量且有效对抗样本的方法。我们让 BERT 对抗其微调模型及下游任务中的其他深度神经模型,从而能够成功误导目标模型做出错误预测。我们的方法在成功率和扰动比例上均优于 SOTA 攻击策略,且生成的对抗样本流畅并保留语义。此外,计算代价低,因此可大规模生成。代码见 https://github.com/LinyangLee/BERT-Attack。
引用
@article{arxiv.2004.09984,
title = {BERT-ATTACK: Adversarial Attack Against BERT Using BERT},
author = {Linyang Li and Ruotian Ma and Qipeng Guo and Xiangyang Xue and Xipeng Qiu},
journal= {arXiv preprint arXiv:2004.09984},
year = {2020}
}
备注
Accepted by EMNLP2020