中文

增强的阿拉伯语网络欺凌检测:深度嵌入与Transformer(BERT)方法

计算与语言 2025-10-03 v1

摘要

智能手机和通信技术的最新进展,包括 X(原 Twitter)等大型社交媒体网络的增长,通过使年轻人接触网络欺凌、嘲讽和欺凌内容,危及他们的情感健康。大多数自动检测网络欺凌的方法都是围绕英语开发的,而检测阿拉伯语网络欺凌的方法则极为稀缺。本文旨在提高检测阿拉伯语内容中网络欺凌的有效性。我们整理了 10,662 条 X 帖子数据集,对数据进行了预处理,并使用 kappa 工具验证和增强了标注质量。我们进行了四项实验,测试了多种深度学习模型以自动检测阿拉伯语网络欺凌。我们首先测试了具有多种实验性词嵌入的长短期记忆(LSTM)模型和双向长短期记忆(Bi-LSTM)模型。我们还使用新颖的预训练双向编码器表示(BERT)测试了 LSTM 和 Bi-LSTM 模型,然后在不同的实验模型 BERT 上再次测试它们。LSTM-BERT 和 Bi-LSTM-BERT 展示了 97% 的准确率。使用 FastText 嵌入词的 Bi-LSTM 表现更好,达到了 98% 的准确率。因此,结果具有泛化性

关键词

引用

@article{arxiv.2510.02232,
  title  = {Enhanced Arabic-language cyberbullying detection: deep embedding and transformer (BERT) approaches},
  author = {Ebtesam Jaber Aljohani and Wael M. S. Yafoo},
  journal= {arXiv preprint arXiv:2510.02232},
  year   = {2025}
}