基于Transformer深度学习的多语言仇恨言论分析与检测
计算与语言
2024-03-19 v1 人工智能
信息检索
摘要
仇恨言论是有害内容,它直接攻击或宣扬对群体或个人成员的仇恨,基于实际或感知的身份方面,如种族、宗教或性取向。这可能会影响社交媒体平台上的社会生活,因为通过社交媒体分享的仇恨内容可能伤害个人和社区。随着仇恨言论在网上的流行程度增加,作为NLP任务的自动检测需求也在增加。在这项工作中,提出的方法是使用基于Transformer的模型来检测社交媒体(如Twitter、Facebook、WhatsApp、Instagram等)中的仇恨言论。所提出的模型与语言无关,并已在意大利语、英语、德语、孟加拉语上进行了测试。黄金标准数据集来自著名研究人员Zeerak Talat、Sara Tonelli、Melanie Siegel和Rezaul Karim。所提出的模型用于仇恨言论检测的成功率高于现有的基线和最先进模型,在孟加拉语数据集上的准确率为89%,英语:91%,德语数据集91%,意大利语数据集77%。所提出的算法相比基准方法有显著改进。
引用
@article{arxiv.2401.11021,
title = {Analysis and Detection of Multilingual Hate Speech Using Transformer Based Deep Learning},
author = {Arijit Das and Somashree Nandy and Rupam Saha and Srijan Das and Diganta Saha},
journal= {arXiv preprint arXiv:2401.11021},
year = {2024}
}
备注
20 pages