针对德语仇恨言论 BERT 分类器的白盒攻击及显式与隐式字符级防御
计算与语言
2022-02-15 v2
摘要
在这项工作中,我们评估了在德语仇恨言论数据集上训练的 BERT 模型的对抗鲁棒性。我们还通过两种新颖的白盒字符级和词级攻击补充了我们的评估,从而丰富了现有攻击手段。此外,我们还对两种新颖的字符级防御策略进行了比较,并相互评估了它们的鲁棒性。
引用
@article{arxiv.2202.05778,
title = {White-Box Attacks on Hate-speech BERT Classifiers in German with Explicit and Implicit Character Level Defense},
author = {Shahrukh Khan and Mahnoor Shahid and Navdeeppal Singh},
journal= {arXiv preprint arXiv:2202.05778},
year = {2022}
}