利用多语言 Transformer 进行仇恨言论检测
计算与语言
2021-01-12 v1 人工智能
计算机与社会
信息检索
机器学习
摘要
检测和分类社交媒体文本中的仇恨实例近年来一直是自然语言处理中的关注问题。我们的工作利用最先进的 Transformer 语言模型在多语言环境下识别仇恨言论。捕捉社交媒体上帖子或评论的意图涉及对语言风格、语义内容以及标签和表情符号等附加指示的细致评估。在本文中,我们考察识别一条 Twitter 帖子是否具有仇恨性和攻击性的问题。我们进一步将检测出的有害内容区分为以下三类之一:(a) 仇恨言论(HATE),(b) 攻击性(OFFN)和 (c) 亵渎(PRFN)。以一个预训练的多语言基于 Transformer 的文本编码器为基础,我们成功识别并分类了多种语言中的仇恨言论。在提供的测试语料上,我们在仇恨言论检测上分别取得英语、德语和印地语的 Macro F1 分数 90.29、81.87 和 75.40,在细粒度分类上取得 60.70、53.28 和 49.74。在我们的实验中,我们展示了 Perspective API 特征对仇恨言论分类的有效性以及利用多语言训练方案的效果。我们提供了特征选择研究以说明特定特征对该架构分类头的影响。
引用
@article{arxiv.2101.03207,
title = {Leveraging Multilingual Transformers for Hate Speech Detection},
author = {Sayar Ghosh Roy and Ujwal Narayan and Tathagata Raha and Zubair Abid and Vasudeva Varma},
journal= {arXiv preprint arXiv:2101.03207},
year = {2021}
}
备注
To be published in: FIRE (Working Notes) 2020, Hate Speech and Offensive Content Identification in Indo-European Languages, HASOC 2020