中文

倾听受影响社群以定义极端言论:数据集与实验

计算与语言 2022-03-23 v1 人工智能

摘要

基于当前关于多语言仇恨言论(如 Ousidhoum 等 (2019))和仇恨言论消减(如 Sap 等 (2020))的研究,我们提出了 XTREMESPEECH,一个包含来自巴西、德国、印度和肯尼亚的 20,297 条社交媒体段落的新型仇恨言论数据集。其关键创新在于我们直接让受影响社群参与数据的收集与标注,而非由公司和政府控制仇恨言论的定义与对抗。这种包容性方法使数据集更能代表实际发生的在线言论,并有望促进移除被边缘化社群视为造成最大伤害的社交媒体内容。基于 XTREMESPEECH,我们建立了带有基线的新型任务,提供了跨国训练通常由于国家间文化差异而不可行的证据,并对 BERT 的预测进行了可解释性分析。

关键词

引用

@article{arxiv.2203.11764,
  title  = {Listening to Affected Communities to Define Extreme Speech: Dataset and Experiments},
  author = {Antonis Maronikolakis and Axel Wisiorek and Leah Nann and Haris Jabbar and Sahana Udupa and Hinrich Schuetze},
  journal= {arXiv preprint arXiv:2203.11764},
  year   = {2022}
}

备注

Accepted to ACL 2022 Findings