HotFlip:面向文本分类的白盒对抗样本
计算与语言
2018-05-25 v2 机器学习
摘要
我们提出一种高效方法来生成白盒对抗样本以欺骗字符级神经分类器。我们发现仅需少量篡改即可大幅降低准确率。我们的方法依赖于一种原子翻转操作,该操作基于独热输入向量的梯度将一个词元替换为另一个。由于方法的高效性,我们可以进行对抗训练,使模型在测试时更鲁棒于攻击。借助少量保持语义的约束,我们展示了 HotFlip 也可适用于攻击词级分类器。
引用
@article{arxiv.1712.06751,
title = {HotFlip: White-Box Adversarial Examples for Text Classification},
author = {Javid Ebrahimi and Anyi Rao and Daniel Lowd and Dejing Dou},
journal= {arXiv preprint arXiv:1712.06751},
year = {2018}
}