LAHM:面向多领域与多语言仇恨言论识别的大型标注数据集
计算与语言
2023-04-04 v1 人工智能
摘要
当前关于仇恨言论分析的研究通常面向单语和单一分类任务。本文提出了一个针对英语、印地语、阿拉伯语、法语、德语和西班牙语的多语言仇恨言论分析数据集,覆盖仇恨言论的多个领域——辱骂、种族主义、性别歧视、宗教仇恨与极端主义。据我们所知,本文首次致力于在这六种语言中识别这五个广泛领域内的各类仇恨言论。在这项工作中,我们描述了如何创建该数据集,如何为不同领域创建高层级与低层级标注,以及如何利用它来测试当前最先进的多语言与多任务学习方法。我们在多种单语、跨语言和机器翻译分类设定下评估了我们的数据集,并将其与为此任务聚合和合并的开源英语数据集进行了对比。随后我们讨论了如何利用该方法创建大规模仇恨言论数据集,以及如何借助我们的标注来普遍改进仇恨言论检测与分类。
引用
@article{arxiv.2304.00913,
title = {LAHM : Large Annotated Dataset for Multi-Domain and Multilingual Hate Speech Identification},
author = {Ankit Yadav and Shubham Chandel and Sushant Chatufale and Anil Bandhakavi},
journal= {arXiv preprint arXiv:2304.00913},
year = {2023}
}