文本分类中的模型鲁棒性:保语义对抗攻击
计算与语言
2020-08-17 v2 机器学习
摘要
我们提出用于生成对抗攻击的算法,以评估文本分类问题中的模型鲁棒性。这些算法可用于生成白盒攻击与黑盒攻击,同时保留原始文本的语义与句法。这些攻击在白盒设定下引发了大量的标签翻转,而相同的基于规则的攻击可用于黑盒设定。在黑盒设定下,所生成的攻击能够逆转基于Transformer架构的决策。
引用
@article{arxiv.2008.05536,
title = {Model Robustness with Text Classification: Semantic-preserving adversarial attacks},
author = {Rahul Singh and Tarun Joshi and Vijayan N. Nair and Agus Sudjianto},
journal= {arXiv preprint arXiv:2008.05536},
year = {2020}
}
备注
12 Pages, 3 Figures, 10 Tables