中文

保护谷歌语言毒性模型免受对抗攻击

计算与语言 2018-01-08 v1 社会与信息网络

摘要

在线社区缺乏审核使得参与者可能遭受人身攻击、骚扰或网络欺凌,在当代后真相政治情境下极端主义激进化的加剧使这些问题更为突出。此类敌意通常通过使用有毒语言、亵渎性言辞或辱骂性陈述来表达。近期谷歌开发了一个基于机器学习的毒性模型,试图评估评论的敌意程度;遗憾的是,有观点认为该模型可被操纵评论文本序列的对抗攻击所欺骗。本文中,我们首先将这些对抗攻击刻画为使用混淆(obfuscation)与极性变换(polarity transformations)。前者通过排版编辑破坏毒性触发内容来欺骗,后者通过对毒性内容进行语法否定来欺骗。随后,我们提出一种两阶段方法来反击这些异常,该方法建立在近期提出的文本去混淆方法与毒性评分模型之上。最后,我们使用约24000条失真评论进行了实验,表明以此方式可恢复对抗变体的毒性,而处理时间大约增加一倍。尽管由书面语言多变性衍生的新型对抗挑战会不断出现,我们预期需要结合机器学习与文本模式识别技术(各自针对不同的语言特征层)以实现对有毒语言的稳健检测,从而促进无攻击的数字交互。

关键词

引用

@article{arxiv.1801.01828,
  title  = {Shielding Google's language toxicity model against adversarial attacks},
  author = {Nestor Rodriguez and Sergio Rojas-Galeano},
  journal= {arXiv preprint arXiv:1801.01828},
  year   = {2018}
}