基于预训练语言模型集成与数据增强的阿拉伯推文仇恨言论检测
计算与语言
2024-07-03 v1 人工智能
摘要
今天,来自阿拉伯推文的仇恨言论分类已引起数十位研究者的注意。针对这一分类任务,已经开发出各种系统和技术。然而,两个主要挑战仍困扰着这一领域:性能有限和数据不平衡的问题。本研究提出了一种新方法,利用集成学习和基于先前手动标记的半监督学习。我们在一个基准数据集上进行实验,将阿拉伯推文分类为5个 distinct 类:非仇恨、一般仇恨、种族仇恨、宗教仇恨或性别仇恨。实验结果显示:(1) 基于预训练语言模型的集成学习优于现有相关工作;(2) 我们提出的数据增强方法提高了阿拉伯推文仇恨言论检测的准确率,并优于现有相关工作。我们的主要贡献是实现了在阿拉伯仇恨言论检测方面的鼓舞人心的结果。
引用
@article{arxiv.2407.02448,
title = {Ensemble of pre-trained language models and data augmentation for hate speech detection from Arabic tweets},
author = {Kheir Eddine Daouadi and Yaakoub Boualleg and Kheir Eddine Haouaouchi},
journal= {arXiv preprint arXiv:2407.02448},
year = {2024}
}