中文

基于深度学习模型和预训练模型微调的阿拉伯语仇恨言论识别与遮蔽

计算与语言 2025-08-01 v1

摘要

社交媒体中的仇恨言论识别在近年来成为越来越重要的问题。本研究 addresses 两个问题:1) 检测阿拉伯语文本中的仇恨言论,2) 清理包含仇恨言论的文本。所谓清理,指将每个不良单词根据单词字母数替换为星号。在解决第一个问题时,我们使用深度学习模型和 transformer 对不同模型的 F1 分数进行实验,以确定最佳模型。在第二个问题上,我们将其视为机器翻译任务,输入为包含脏话的句子,输出为屏蔽脏话的句子。所提出的方法在仇恨言论检测中取得最佳模型,达到 92% 的宏 F1 分数和 95% 的准确率。在文本清理实验中,仇恨言论遮蔽模型在 1-gram上的 BLEU 分数达到 0.3,这与当前最先进的机器翻译系统相比仍是良好结果。

关键词

引用

@article{arxiv.2507.23661,
  title  = {Arabic Hate Speech Identification and Masking in Social Media using Deep Learning Models and Pre-trained Models Fine-tuning},
  author = {Salam Thabet Doghmash and Motaz Saad},
  journal= {arXiv preprint arXiv:2507.23661},
  year   = {2025}
}

备注

23 pages, 5 figures