中文

DeL-haTE:一种用于仇恨言论检测的深度学习可调集成方法

计算与语言 2020-11-04 v1 机器学习

摘要

近年来,社交媒体上的在线仇恨言论已成为一个快速增长的问题。恶意团体已在多个主流(Twitter和Facebook)与边缘(Gab、4chan、8chan等)平台上建立了大型内容分发网络,以传播针对个人和社区的仇恨信息浪潮。因此,解决这些问题已成为大型社交媒体平台的当务之急。自动化检测与分类仇恨内容的三大挑战是:缺乏清晰标注的数据、不断演化的词汇与词典(标签、表情符号等),以及缺乏针对Gab等边缘平台的基线模型。本工作中,我们提出一种具有三项主要贡献的新框架:(a) 我们设计了一个结合最先进方法优势的深度学习模型集成;(b) 我们在框架中引入一个利用迁移学习的调优因子,以对Gab等未标注数据集进行自动化仇恨言论分类;(c) 我们开发了一种弱监督学习方法,使框架能在未标注数据上训练。我们的集成模型在HON数据集上达到83%的仇恨召回率,超越了SOTA(最先进)深度模型的性能。我们证明,弱监督训练结合分类器调优显著提升了模型在Gab未标注数据上的表现,达到67%的仇恨召回率。

关键词

引用

@article{arxiv.2011.01861,
  title  = {DeL-haTE: A Deep Learning Tunable Ensemble for Hate Speech Detection},
  author = {Joshua Melton and Arunkumar Bagavathi and Siddharth Krishnan},
  journal= {arXiv preprint arXiv:2011.01861},
  year   = {2020}
}

备注

Accepted at ICMLA20 Special Session: Machine Learning for Natural Language Processing