中文

用于仇恨言论检测的字符级 HyperNetworks

计算与语言 2022-05-23 v2

摘要

针对特定子群体、以仇恨内容为核心的仇恨言论的大规模传播,是一个具有关键社会重要性的问题。仇恨言论检测的自动化方法通常采用最先进的深度学习(DL)文本分类器——参数超过一亿的预训练神经语言模型,并利用相关标注数据集将这些模型适配于仇恨言论检测任务。遗憾的是,为此可用的公开标注数据集寥寥且规模有限。我们作出若干有望改善此现状的贡献。我们提出用于仇恨言论检测的 HyperNetworks,这是一类特殊的 DL 网络,其权重由一个小规模辅助网络调控。这些架构在字符级而非词或子词级上运作,且比流行的 DL 分类器小数个数量级。我们进一步表明,使用额外大量自动生成的样本训练仇恨检测分类器总体有益,且尤其能提升所提 HyperNetworks 的性能。我们报告了广泛实验的结果,使用五个公开数据集评估多种神经架构在仇恨检测上的表现。所评估方法包括 BERT、RoBERTa、ALBERT、MobileBERT 和 CharBERT(一种融合字符与子词嵌入的 BERT 变体)等预训练语言模型。除传统的域内评估设置外,我们还进行了跨数据集评估实验,在数据偏移条件下检验各模型的泛化能力。结果表明,所提 HyperNetworks 取得了具竞争力的性能,且在部分情况下优于这些预训练语言模型,同时规模小数个数量级。

关键词

引用

@article{arxiv.2111.06336,
  title  = {Character-level HyperNetworks for Hate Speech Detection},
  author = {Tomer Wullach and Amir Adler and Einat Minkov},
  journal= {arXiv preprint arXiv:2111.06336},
  year   = {2022}
}