中文

论攻击性语言分类器的鲁棒性

计算与语言 2022-03-23 v1 机器学习

摘要

社交媒体平台正在部署基于机器学习的攻击性语言分类系统,以大规模打击仇恨、种族主义及其他形式的攻击性言论。然而,尽管已在现实世界中部署,我们尚未全面理解攻击性语言分类器对抗 adversarial 攻击的鲁棒程度。该领域的先前工作仅限于研究分类器对拼写错误和多余空格等原始攻击的鲁棒性。为弥补这一不足,我们系统分析了最先进(state-of-the-art)攻击性语言分类器针对更巧妙 adversarial 攻击的鲁棒性,这些攻击利用基于贪心和注意力的词选择以及上下文感知嵌入进行词语替换。我们在多个数据集上的结果表明,这些巧妙的 adversarial 攻击可使攻击性语言分类器的准确率下降超过 50%,同时还能保持修改后文本的可读性与语义。

关键词

引用

@article{arxiv.2203.11331,
  title  = {On The Robustness of Offensive Language Classifiers},
  author = {Jonathan Rusert and Zubair Shafiq and Padmini Srinivasan},
  journal= {arXiv preprint arXiv:2203.11331},
  year   = {2022}
}

备注

9 pages, 2 figures, Accepted at ACL 2022