阿尔巴尼亚语辱骂性内容检测
计算与语言
2022-05-11 v3
摘要
近年来社交媒体的不断增长使用对在线平台中仇恨言论和攻击性言论存在的增加产生了直接影响。对此类内容有效检测的研究主要集中于英语和少数其他广泛使用的语言,而其余大多数语言未能获得同等工作投入,因此无法从该领域稳步进展中受益。在本文中我们提出 \textsc{Shaj},一个从各类社交媒体平台用户生成内容构建的阿尔巴尼亚语仇恨言论与攻击性言论标注数据集。其标注遵循 OffensEval 中引入的层次化模式。该数据集使用三种不同分类模型进行测试,其中最佳模型在攻击性语言识别上达到 0.77 的 F1 分数,在攻击性类型自动分类上达到 0.64 的 F1 分数,以及在攻击性语言目标识别上达到 0.52 的 F1 分数。
引用
@article{arxiv.2107.13592,
title = {Detecting Abusive Albanian},
author = {Erida Nurce and Jorgel Keci and Leon Derczynski},
journal= {arXiv preprint arXiv:2107.13592},
year = {2022}
}