FIRE 2022 中 HASOC 子赛道概述:马拉地语攻击性语言识别
计算与语言
2022-11-21 v1 人工智能
计算机与社会
机器学习
社会与信息网络
摘要
近年来,网络上攻击性内容的广泛传播已成为一个令人严重关切的问题,促使研究人员开发能够自动识别此类内容的鲁棒系统。为了对这些系统进行公平评估,已组织了若干国际竞赛,为社区提供了针对多种语言的重要基准数据和评估方法。HASOC(仇恨言论与攻击性内容识别)共享任务自 2019 年组织以来便是此类举措之一。在第四届中,HASOC 2022 包含了英语、印地语和马拉地语三个子赛道。在本文中,我们报告了 HASOC 2022 马拉地语子赛道的结果,该子赛道为参与者提供了一个包含来自 Twitter 的数据的数据集,并使用流行的 OLID 分类法进行了人工标注。马拉地语赛道设有三个附加子赛道,每个对应于分类法的一个层级:任务 A——攻击性内容识别(攻击性 vs. 非攻击性);任务 B——攻击性类型分类(有针对性 vs. 无针对性);任务 C——攻击性目标识别(个人 vs. 群体 vs. 其他)。总体而言,10 支队伍提交了 59 次运行。最佳系统在子赛道 3A 上获得了 0.9745 的 F1,在子赛道 3B 上获得了 0.9207 的 F1,在子赛道 3C 上获得了 0.9607 的 F1。性能最佳的算法是传统方法与深度学习方法的混合。
引用
@article{arxiv.2211.10163,
title = {Overview of the HASOC Subtrack at FIRE 2022: Offensive Language Identification in Marathi},
author = {Tharindu Ranasinghe and Kai North and Damith Premasiri and Marcos Zampieri},
journal= {arXiv preprint arXiv:2211.10163},
year = {2022}
}