基于注意力循环神经网络的社交媒体孟加拉语仇恨言论检测
计算与语言
2022-04-01 v1 人工智能
机器学习
摘要
仇恨言论通过日常技术使用,尤其是通过在社交媒体上以负面方式分享个人观点或感受,传播得更为迅速。尽管在英语、德语及其他语言的仇恨言论检测方面已有大量工作,但在孟加拉语语境下的研究甚少。相比之下,数百万人在社交媒体上使用孟加拉语交流。现有少数工作在准确率和可解释性方面均有待提升。本文提出基于编码器-解码器的机器学习模型(NLP 中一种常用工具),用于对 Facebook 页面上的用户孟加拉语评论进行分类。我们使用包含 7,425 条孟加拉语评论、涵盖七类不同仇恨言论的数据集来训练和评估模型。为从评论中提取并编码局部特征,采用了 1D 卷积层。最后,基于注意力机制、LSTM 和 GRU 的解码器被用于预测仇恨言论类别。在三种编码器-解码器算法中,基于注意力的解码器取得了最佳准确率(77%)。
引用
@article{arxiv.2203.16775,
title = {Bangla hate speech detection on social media using attention-based recurrent neural network},
author = {Amit Kumar Das and Abdullah Al Asif and Anik Paul and Md. Nur Hossain},
journal= {arXiv preprint arXiv:2203.16775},
year = {2022}
}