L3Cube-MahaHate:基于推文的马拉地语仇恨语音检测数据集与 BERT 模型
计算与语言
2022-05-24 v2 机器学习
摘要
社交媒体平台被大量人群主要用于表达其想法与观点。然而,这些平台也导致了大量的仇恨与 abusive 内容。因此,遏制此类平台上的仇恨语音传播十分重要。在印度,马拉地语是被广泛受众使用的最流行语言之一。在本工作中,我们提出 L3Cube-MahaHate,首个主要的马拉地语仇恨语音数据集。该数据集从 Twitter 策划并人工标注。我们的数据集包含超过 25000 条独立推文,标注为四个主要类别即仇恨、攻击性、亵渎和非。我们展示了收集与标注数据所采用的方法以及过程中面临的挑战。最后,我们给出基于 CNN、LSTM 和 Transformers 的深度学习模型的基线分类结果。我们探索了 BERT 的单语与多语变体如 MahaBERT、IndicBERT、mBERT 和 xlm-RoBERTa,并表明单语模型优于其多语对应模型。MahaBERT 模型在 L3Cube-MahaHate 语料上给出了最佳结果。数据与模型见 https://github.com/l3cube-pune/MarathiNLP。
引用
@article{arxiv.2203.13778,
title = {L3Cube-MahaHate: A Tweet-based Marathi Hate Speech Detection Dataset and BERT models},
author = {Abhishek Velankar and Hrushikesh Patil and Amol Gore and Shubham Salunke and Raviraj Joshi},
journal= {arXiv preprint arXiv:2203.13778},
year = {2022}
}