中文

BD-SHS:用于学习在不同社会语境中检测在线孟加拉语仇恨言论的基准数据集

计算与语言 2022-06-02 v1

摘要

社交媒体平台和在线流媒体服务催生了新型仇恨言论(HS)。由于这些站点上用户生成内容海量,现代机器学习技术被证明可行且具成本效益来解决此问题。然而,需要涵盖通常使用攻击性语言的不同社会语境且语言多样的数据集来训练可泛化模型。在本文中,我们指出现有孟加拉语 HS 数据集的不足,并引入一个大型人工标注数据集 BD-SHS,其包含不同社会语境中的 HS。标注标准按分层标注流程制定,据我们所知这是孟加拉语 HS 中的首例。该数据集包含从在线社交网络站点爬取的超过 50,200 条攻击性评论,比任何现有孟加拉语 HS 数据集至少大 60%。我们通过训练不同 NLP 模型给出数据集的基准结果,最优模型达到 91.0% 的 F1 分数。在我们的实验中,我们发现仅使用来自社交媒体和流媒体站点的 147 万条评论训练的词嵌入,相较于其他预训练嵌入,持续更好地建模 HS 检测。我们的数据集及所有附带代码公开于 github.com/naurosromim/hate-speech-dataset-for-Bengali-social-media

关键词

引用

@article{arxiv.2206.00372,
  title  = {BD-SHS: A Benchmark Dataset for Learning to Detect Online Bangla Hate Speech in Different Social Contexts},
  author = {Nauros Romim and Mosahed Ahmed and Md. Saiful Islam and Arnab Sen Sharma and Hriteshwar Talukder and Mohammad Ruhul Amin},
  journal= {arXiv preprint arXiv:2206.00372},
  year   = {2022}
}