阿拉伯语攻击性语言训练的自动扩展与重定向
计算与语言
2021-11-19 v1
摘要
社交媒体上攻击性语言的泛滥导致了近期关于此类语言自动识别的研究努力。尽管攻击性语言具有一般特征,但对特定实体的攻击可能表现出独特现象,例如对名称拼写进行恶意篡改。本文提出一种识别针对特定实体的攻击性语言的方法。我们采用两个关键见解,即 Twitter 上的回复往往暗示对立,以及某些账户持续地对特定目标表现出攻击性。使用我们的方法,能够收集数千条定向攻击性推文。我们在阿拉伯语推文上展示了该方法的有效性:在使用基于深度学习和基于支持向量机的分类器时,针对特定实体的攻击性语言检测的 F1 值相对分别提升 13% 和 79%。此外,用自动识别出的针对多个实体的攻击性推文扩展训练集可使 F1 值提升 48%。
引用
@article{arxiv.2111.09574,
title = {Automatic Expansion and Retargeting of Arabic Offensive Language Training},
author = {Hamdy Mubarak and Ahmed Abdelali and Kareem Darwish and Younes Samih},
journal= {arXiv preprint arXiv:2111.09574},
year = {2021}
}