中文

词嵌入模型对仇恨与攻击性语音检测的影响

计算与语言 2020-12-15 v1 机器学习

摘要

深度神经网络已成功应用于仇恨语音检测问题。然而,词嵌入模型对神经网络性能的影响在文献中尚未得到适当考察。在我们的研究中,通过不同的检测任务(2 类、3 类和 6 类分类),我们研究了词嵌入模型和神经网络架构对预测准确性的影响。我们的关注点是阿拉伯语。我们首先在大规模无标注阿拉伯语文本语料库上训练若干词嵌入模型。接着,基于一个阿拉伯语仇恨与攻击性语音数据集,对于每个检测任务,我们使用预训练的词嵌入模型训练若干神经网络分类器。该任务产生了大量不同的已学习模型,从而允许进行详尽比较。实证分析一方面证明了 skip-gram 模型的优越性,另一方面证明了 CNN 网络在三个检测任务中的优越性。

关键词

引用

@article{arxiv.2012.07534,
  title  = {Effect of Word Embedding Models on Hate and Offensive Speech Detection},
  author = {Safa Alsafari and Samira Sadaoui and Malek Mouhoub},
  journal= {arXiv preprint arXiv:2012.07534},
  year   = {2020}
}