面向变长文本对抗攻击
计算与语言
2021-04-19 v1
摘要
对抗攻击已显示出机器学习模型的脆弱性,然而由于数据的离散性,在自然语言处理任务上实施文本对抗攻击并非易事。大多数先前的方法采用原子化的替换操作进行攻击,通常导致定长对抗样本,从而限制了对决策空间的探索。在本文中,我们提出变长文本对抗攻击(VL-Attack),并将插入、删除和替换三种原子操作整合到一个统一框架中,通过在攻击时引入并操纵一个特殊的空白标记来实现。以此方式,我们的方法能够更全面地寻找决策边界附近的对抗样本并有效实施对抗攻击。具体而言,在攻击预训练 BERT 模型时,我们的方法仅编辑 的标记就将 IMDB 分类准确率降低了 。此外,使用生成的对抗样本对受害模型进行微调可在不损害性能的情况下提升模型的鲁棒性,尤其对于长度敏感模型。在非自回归机器翻译任务上,我们的方法在 IWSLT14 德英翻译上取得了 的 BLEU 分数,较基线模型提升了 。
引用
@article{arxiv.2104.08139,
title = {Towards Variable-Length Textual Adversarial Attacks},
author = {Junliang Guo and Zhirui Zhang and Linlin Zhang and Linli Xu and Boxing Chen and Enhong Chen and Weihua Luo},
journal= {arXiv preprint arXiv:2104.08139},
year = {2021}
}