结合情感、情绪与目标检测的多任务学习以识别仇恨言论与攻击性语言
摘要
仇恨言论与攻击性语言(HOF)的识别通常被构建为判断文本是否含 HOF 的分类任务。我们探究 HOF 检测是否可通过考虑 HOF 与相似概念间的关系而受益:(a)HOF 与情感分析相关,因为仇恨言论通常是负面陈述并表达负面意见;(b)它与情绪分析相关,因为所表达的仇恨指向作者正在(或假装)经历愤怒,而受众正在(或被意图)经历恐惧。(c)最后,HOF 的一个构成要素是对目标人物或群体的提及。基于此,我们假设 HOF 检测在与这些概念联合建模、以多任务学习设置进行时会有改进。我们的实验基于上述各概念的已有数据集(情感、情绪、HOF 目标),并作为 HASOC FIRE 2021 英文 Subtask 1A 的参与者(团队 IMS-SINAI)评估我们的模型。在考虑多种可用资源及向共享任务提交结果的模型选择实验中,我们发现 CrowdFlower 情绪语料库、SemEval 2016 情感语料库与 OffensEval 2019 目标检测数据的组合,在基于 BERT 的多头多任务学习模型中取得 F1 = .79,而普通 BERT 为 .7895。在 HASOC 2019 测试数据上,该结果更为显著,F1 提升 2 个百分点且召回率大幅提升。在两组数据集(2019、2021)上,HOF 类的召回率尤其提升(2019 数据 6pp,2021 数据 3pp),表明结合情绪、情感与目标识别的 MTL 是可用于社交媒体平台早期预警系统的合适方法。
引用
@article{arxiv.2109.10255,
title = {Multi-Task Learning with Sentiment, Emotion, and Target Detection to Recognize Hate Speech and Offensive Language},
author = {Flor Miriam Plaza-del-Arco and Sercan Halat and Sebastian Padó and Roman Klinger},
journal= {arXiv preprint arXiv:2109.10255},
year = {2022}
}
备注
publication at FIRE 2021 as system description paper in the HASOC-FIRE shared task on hate speech and offensive language detection. The original publication can be found at http://ceur-ws.org/Vol-3159/T1-30.pdf