中文

针对德语仇恨言论 BERT 分类器的白盒攻击及显式与隐式字符级防御

计算与语言 2022-02-15 v2

摘要

在这项工作中,我们评估了在德语仇恨言论数据集上训练的 BERT 模型的对抗鲁棒性。我们还通过两种新颖的白盒字符级和词级攻击补充了我们的评估,从而丰富了现有攻击手段。此外,我们还对两种新颖的字符级防御策略进行了比较,并相互评估了它们的鲁棒性。

关键词

引用

@article{arxiv.2202.05778,
  title  = {White-Box Attacks on Hate-speech BERT Classifiers in German with Explicit and Implicit Character Level Defense},
  author = {Shahrukh Khan and Mahnoor Shahid and Navdeeppal Singh},
  journal= {arXiv preprint arXiv:2202.05778},
  year   = {2022}
}