HS-BAN: 用于孟加拉语仇恨语音检测的社交媒体评论基准数据集
计算与语言
2021-12-06 v1
摘要
在本文中,我们提出 HS-BAN,一个孟加拉语二分类仇恨语音(HS)数据集,包含超过 50,000 条标注评论,其中 40.17% 为仇恨语音,其余为非仇恨语音。在数据集准备过程中,我们遵循严格且详细的标注指南以减少人工标注偏差。该 HS 数据集还进行了语言学预处理,以提取人们当前使用符号、缩写或替代拼写所写出的各类俚语。这些俚语词被进一步归类为传统与非传统俚语列表,并包含在本文结果中。我们探索了传统语言学特征与基于神经网络的方法,以构建孟加拉语仇恨语音检测的基准系统。实验结果表明,用非正式文本训练的现有词嵌入模型优于用正式文本训练的模型。我们的基准显示,基于 FastText 非正式词嵌入的 Bi-LSTM 模型取得了 86.78% 的 F1 分数。我们将公开提供该数据集以供使用。
引用
@article{arxiv.2112.01902,
title = {HS-BAN: A Benchmark Dataset of Social Media Comments for Hate Speech Detection in Bangla},
author = {Nauros Romim and Mosahed Ahmed and Md Saiful Islam and Arnab Sen Sharma and Hriteshwar Talukder and Mohammad Ruhul Amin},
journal= {arXiv preprint arXiv:2112.01902},
year = {2021}
}
备注
Submitted to ICON 21 (Rejected)