FIRE 2021 乌尔都语辱骂与威胁性语言检测概述
计算与语言
2022-07-15 v1
摘要
随着社交媒体平台影响力的增长,其被滥用的后果变得越来越严重。自动检测威胁性和辱骂性语言的重要性不容低估。然而,现有的多数研究和 SOTA 方法以英语为目标语言,对低资源和中资源语言的研究有限。在本文中,我们提出了针对乌尔都语(全球有超过 1.7 亿使用者)的辱骂和威胁性语言检测的两个共享任务。两者均被设定为二分类任务,参赛系统需要将乌尔都语推文分为两类,即:(i)第一个任务分为辱骂和非辱骂,(ii)第二个任务分为威胁和非威胁。我们提供了两个手动标注的数据集,包含标记为(i)辱骂和非辱骂,以及(ii)威胁和非威胁的推文。辱骂数据集在训练部分包含 2400 条标注推文,在测试部分包含 1100 条标注推文。威胁数据集在训练部分包含 6000 条标注推文,在测试部分包含 3950 条标注推文。我们还为两项任务提供了基于逻辑回归和 BERT 的基线分类器。在此共享任务中,来自六个国家(印度、巴基斯坦、中国、马来西亚、阿拉伯联合酋长国和中国台湾)的 21 支队伍注册参赛,10 支队伍提交了子任务 A(辱骂语言检测)的运行结果,9 支队伍提交了子任务 B(威胁性语言检测)的运行结果,七支队伍提交了技术报告。表现最佳的系统在子任务 A 中取得了 0.880 的 F1-score,在子任务 B 中取得了 0.545。对于两个子任务,基于 m-BERT 的 Transformer 模型表现最佳。
引用
@article{arxiv.2207.06710,
title = {Overview of Abusive and Threatening Language Detection in Urdu at FIRE 2021},
author = {Maaz Amjad and Alisa Zhila and Grigori Sidorov and Andrey Labunets and Sabur Butta and Hamza Imam Amjad and Oxana Vitman and Alexander Gelbukh},
journal= {arXiv preprint arXiv:2207.06710},
year = {2022}
}