中文

迈向无毒景观:基于 DNN 的自动毒性评论检测

机器学习 2020-09-18 v2 机器学习

摘要

互联网的惊人扩张导致了自然语言处理领域一个新研究问题的出现:自动毒性评论检测,因为许多国家禁止公共媒体中的仇恨言论。对于仇恨、攻击性、毒性和辱骂性言论尚无清晰且正式的定义。在本文中,我们将所有这些术语归在“毒性”言论之下。本文的贡献是设计了基于二分类与回归的方法,旨在预测一条评论是否有毒。我们比较了不同的无监督词表示与不同的基于 DNN 的分类器。此外,我们通过添加一个(健康或毒性)词研究了所提方法对对抗攻击的鲁棒性。我们在英文维基百科 Detox 语料库上评估了所提方法。我们的实验表明,使用 BERT 微调优于基于特征的 BERT、Mikolov 与 fastText 表示结合不同 DNN 分类器。

关键词

引用

@article{arxiv.1911.08395,
  title  = {Towards non-toxic landscapes: Automatic toxic comment detection using DNN},
  author = {Ashwin Geet D'Sa and Irina Illina and Dominique Fohr},
  journal= {arXiv preprint arXiv:1911.08395},
  year   = {2020}
}