中文

HateBERT:为英语辱骂性语言检测重训练BERT

计算与语言 2021-02-05 v2

摘要

本文介绍HateBERT,一个为英语辱骂性语言检测而重训练的BERT模型。该模型在RAL-E上训练,RAL-E是我们收集并公开的一个大规模英语Reddit评论数据集,来自因冒犯性、辱骂性或仇恨性而被封禁的社区。我们详细比较了通用预训练语言模型与通过使用被封禁社区帖子重训练得到的辱骂倾向版本,在三个英语数据集上针对冒犯性、辱骂性语言和仇恨言论检测任务的结果。在所有数据集中,HateBERT均优于对应的通用BERT模型。我们还讨论了一系列实验,比较通用预训练语言模型及其对应辱骂语言倾向版本在数据集间的可移植性,表明可移植性受标注现象兼容性的影响。

关键词

引用

@article{arxiv.2010.12472,
  title  = {HateBERT: Retraining BERT for Abusive Language Detection in English},
  author = {Tommaso Caselli and Valerio Basile and Jelena Mitrović and Michael Granitzer},
  journal= {arXiv preprint arXiv:2010.12472},
  year   = {2021}
}