中文

TEET!用于有毒言论检测的突尼斯数据集

计算与语言 2021-10-12 v1 人工智能

摘要

社交媒体中完全的表达自由有其代价,尤其体现在传播可能诱导人们相应行动的有害与 abusive 内容。因此,自动检测此类内容成为一项紧迫任务,将有助于提升限制这种毒性传播的效率。与其他大多基于现代标准阿拉伯语(MSA)的阿拉伯方言相比,突尼斯方言是 MSA、塔马齐格特语、意大利语和法语等多种语言的混合。由于其丰富的语言,缺乏大型标注数据集使得处理 NLP 问题颇具挑战。本文我们引入一个由约 1 万条评论组成的新标注数据集。我们通过特征工程方法对其词汇进行深入探究,并给出 NB 和 SVM 等机器学习分类器以及 ARBERT、MARBERT 和 XLM-R 等深度学习模型的分类性能结果。

关键词

引用

@article{arxiv.2110.05287,
  title  = {TEET! Tunisian Dataset for Toxic Speech Detection},
  author = {Slim Gharbi and Heger Arfaoui and Hatem Haddad and Mayssa Kchaou},
  journal= {arXiv preprint arXiv:2110.05287},
  year   = {2021}
}