探索冒犯性和仇恨言论的边界与强度:揭示社交媒体话语的复杂谱系
计算与语言
2024-04-19 v1
摘要
数字媒体的普及和不断变化的社会政治动态显著加剧了仇恨内容的传播。现有研究主要集中于将文本分类为二元类别,往往忽略了文本中固有的冒犯性和仇恨性的连续谱。在本研究中,我们提出了一个广泛的阿姆哈拉语基准数据集,包含8,258条推文,标注了三个不同的任务:类别分类、仇恨目标识别以及冒犯性和仇恨性强度评级。我们的研究强调,绝大多数推文属于较低冒犯性和较低仇恨强度级别,强调了利益相关者早期干预的必要性。种族和政治仇恨目标的普遍存在,以及数据集中显著的重叠,强调了埃塞俄比亚社会政治格局中的复杂关系。我们构建了分类和回归模型,并研究了模型处理这些任务的有效性。我们的结果表明,仇恨和冒犯性言论不能通过简单的二元分类来处理,而是表现为连续范围内的变量。Afro-XLMR-large模型表现最佳,在类别、目标和回归任务上分别取得了75.30%、70.59%和29.42%的F1分数。Afro-XLMR-large模型的80.22%相关系数表明强对齐。
引用
@article{arxiv.2404.12042,
title = {Exploring Boundaries and Intensities in Offensive and Hate Speech: Unveiling the Complex Spectrum of Social Media Discourse},
author = {Abinew Ali Ayele and Esubalew Alemneh Jalew and Adem Chanie Ali and Seid Muhie Yimam and Chris Biemann},
journal= {arXiv preprint arXiv:2404.12042},
year = {2024}
}