中文

HABERTOR:一种高效且有效的深度仇恨言论检测器

计算与语言 2020-10-20 v1 人工智能 信息检索 机器学习

摘要

我们提出用于大规模用户生成内容中仇恨言论检测的 HABERTOR 模型。受近期 BERT 模型成功的启发,我们对 BERT 提出若干修改以增强在下游仇恨言论分类任务上的性能。HABERTOR 继承了 BERT 的架构,但在四个方面有所不同:(i) 它生成自己的词表并使用最大规模的仇恨言论数据集从头预训练;(ii) 它由基于四元数的分解组件构成,从而参数数量大幅减少、训练和推理更快,且内存占用更少;(iii) 它使用我们提出的多源集成头与池化层处理分离的输入源,以进一步增强其有效性;以及 (iv) 它使用带有我们提出的细粒度自适应噪声幅度的正则化对抗训练来增强其鲁棒性。通过在具有 140 万条标注评论的大规模真实世界仇恨言论数据集上的实验,我们表明 HABERTOR 优于 15 种最先进的仇恨言论检测方法,包括微调语言模型。特别地,与 BERT 相比,我们的 HABERTOR 在训练/推理阶段快 4~5 倍,使用不到 1/3 的内存,且具有更好的性能,尽管我们预训练所用的词数不到 1%。我们的泛化性分析表明 HABERTOR 能很好地迁移到其他未见过的仇恨言论数据集,并且是 BERT 用于仇恨言论分类的更高效且有效的替代方案。

关键词

引用

@article{arxiv.2010.08865,
  title  = {HABERTOR: An Efficient and Effective Deep Hatespeech Detector},
  author = {Thanh Tran and Yifan Hu and Changwei Hu and Kevin Yen and Fei Tan and Kyumin Lee and Serim Park},
  journal= {arXiv preprint arXiv:2010.08865},
  year   = {2020}
}