中文

WOLI 在 SemEval-2020 任务 12 上的表现:基于不同 Twitter 数据集的阿拉伯语攻击性语言识别

计算与语言 2025-02-19 v1 社会与信息网络

摘要

通过社交平台进行交流已成为个人沟通与互动的主要方式之一。遗憾的是,健康交流常受到攻击性语言的干扰,后者可能对用户造成有害影响。对抗社交媒体中攻击性语言的关键在于存在自动攻击性语言检测系统。本文给出 SemEval-2020 任务 12 OffensEval 子任务 A Zampieri 等人(2020)关于识别与分类社交媒体中攻击性语言的结果与主要发现。该任务基于阿拉伯语 OffensEval 数据集 Mubarak 等人(2020)。本文描述了 WideBot AI Lab 为该共享任务提交的系统,其在 CodaLab 用户名 “yasserotiefy” 下于黄金数据集上以宏 F1 值 86.9% 在 52 个参与者中排名第 10。我们尝试了多种模型,最佳模型为线性 SVM,使用了字符与词 n-gram 的组合。我们还引入了包含 CNN、highway network、Bi-LSTM 与注意力层的神经网络方法,提升了系统的预测能力。

关键词

引用

@article{arxiv.2009.05456,
  title  = {WOLI at SemEval-2020 Task 12: Arabic Offensive Language Identification on Different Twitter Datasets},
  author = {Yasser Otiefy and Ahmed Abdelmalek and Islam El Hosary},
  journal= {arXiv preprint arXiv:2009.05456},
  year   = {2025}
}