中文

欺骗谷歌用于检测有毒评论的Perspective API

机器学习 2017-02-28 v1 计算机与社会 社会与信息网络

摘要

社交媒体平台提供了一个人们可以自由参与讨论的环境。不幸的是,它们也催生了一些问题,例如在线骚扰。最近,谷歌和 Jigsaw 启动了一个名为 Perspective 的项目,该项目利用机器学习来自动检测有毒语言。一个演示网站也已上线,允许任何人在界面中输入短语并即时查看其毒性分数 [1]。在本文中,我们基于对抗样本提出了一种针对 Perspective 毒性检测系统的攻击。我们证明,攻击者可以以一种使系统为其分配显著更低毒性分数的方式,微妙地修改一个剧毒短语。我们将该攻击应用于 Perspective 网站提供的示例短语,并证明我们可以持续地将毒性分数降低到无毒短语的水平。此类对抗样本的存在对毒性检测系统极为有害,并严重损害了其实用性。

关键词

引用

@article{arxiv.1702.08138,
  title  = {Deceiving Google's Perspective API Built for Detecting Toxic Comments},
  author = {Hossein Hosseini and Sreeram Kannan and Baosen Zhang and Radha Poovendran},
  journal= {arXiv preprint arXiv:1702.08138},
  year   = {2017}
}

备注

4 pages