中文

HS-BAN: 用于孟加拉语仇恨语音检测的社交媒体评论基准数据集

计算与语言 2021-12-06 v1

摘要

在本文中,我们提出 HS-BAN,一个孟加拉语二分类仇恨语音(HS)数据集,包含超过 50,000 条标注评论,其中 40.17% 为仇恨语音,其余为非仇恨语音。在数据集准备过程中,我们遵循严格且详细的标注指南以减少人工标注偏差。该 HS 数据集还进行了语言学预处理,以提取人们当前使用符号、缩写或替代拼写所写出的各类俚语。这些俚语词被进一步归类为传统与非传统俚语列表,并包含在本文结果中。我们探索了传统语言学特征与基于神经网络的方法,以构建孟加拉语仇恨语音检测的基准系统。实验结果表明,用非正式文本训练的现有词嵌入模型优于用正式文本训练的模型。我们的基准显示,基于 FastText 非正式词嵌入的 Bi-LSTM 模型取得了 86.78% 的 F1 分数。我们将公开提供该数据集以供使用。

关键词

引用

@article{arxiv.2112.01902,
  title  = {HS-BAN: A Benchmark Dataset of Social Media Comments for Hate Speech Detection in Bangla},
  author = {Nauros Romim and Mosahed Ahmed and Md Saiful Islam and Arnab Sen Sharma and Hriteshwar Talukder and Mohammad Ruhul Amin},
  journal= {arXiv preprint arXiv:2112.01902},
  year   = {2021}
}

备注

Submitted to ICON 21 (Rejected)