仇恨言论标准:面向特定任务仇恨言论定义的模块化方法
计算与语言
2022-07-01 v1
摘要
\textbf{攻击性内容警告}:本文仅包含用于提供阐明本研究的示例的攻击性语言,不代表作者观点。请注意这些示例具有攻击性,可能引起不适。识别\textit{仇恨言论}的主观性使其成为一项复杂任务。这也反映在自然语言处理 (NLP) 中不同且不完备的定义上。我们提出了\textit{仇恨言论}标准,其基于法律与社会科学的视角制定,旨在帮助研究者在五个方面构建更精确的定义与标注指南:(1) 目标群体,(2) 支配性,(3) 施害者特征,(4) 负面群体指称类型,以及 (5) 潜在后果/影响类型。定义可结构化以涵盖更宽泛或更狭窄的现象。由此,可有意识地选择明确标准或留白。我们认为,开发者心中的目标与确切任务应决定\textit{仇恨言论}范围的定义方式。我们提供了来自 \url{hatespeechdata.com} 的英文数据集属性概览,或可助于为特定场景选择最合适的数据集。
引用
@article{arxiv.2206.15455,
title = {Hate Speech Criteria: A Modular Approach to Task-Specific Hate Speech Definitions},
author = {Urja Khurana and Ivar Vermeulen and Eric Nalisnick and Marloes van Noorloos and Antske Fokkens},
journal= {arXiv preprint arXiv:2206.15455},
year = {2022}
}
备注
Accepted at WOAH 2022, co-located at NAACL 2022. Cite ACL version