中文

反犹太言论?高质量标注指南与带标签推文数据集

计算与语言 2023-05-01 v1 计算机与社会

摘要

自动仇恨言论检测的主要挑战之一是缺乏覆盖广泛偏见与非偏见消息且标注一致的数据集。我们提出一种标注流程,以解决带标签数据集的一些常见缺陷。我们聚焦于 Twitter 上的反犹太言论,通过抽取含相关关键词的代表性样本,构建了一个包含 6,941 条推文的带标签数据集,涵盖 2019 年 1 月至 2021 年 12 月间关于犹太人、以色列和反犹太主义的常见对话主题。我们的标注过程旨在严格应用通用的反犹太主义定义,强制标注者指明定义中适用的部分,并允许他们针对具体案例个人不同意该定义。标注那些揭露反犹太主义、报告反犹太主义或虽与反犹太主义相关(如大屠杀)但本身并非反犹太的推文,有助于减少自动检测中的误报。该数据集包含 1,250 条(18%)根据国际大屠杀纪念联盟(IHRA)反犹太主义定义属于反犹太的推文。但需注意,该数据集并不全面。许多主题仍未覆盖,且仅包含 2019 年 1 月至 2021 年 12 月从 Twitter 收集的推文,且只含英文推文。尽管存在这些局限,我们希望这对改进反犹太言论的自动检测是有意义的贡献。

关键词

引用

@article{arxiv.2304.14599,
  title  = {Antisemitic Messages? A Guide to High-Quality Annotation and a Labeled Dataset of Tweets},
  author = {Gunther Jikeli and Sameer Karali and Daniel Miehling and Katharina Soemer},
  journal= {arXiv preprint arXiv:2304.14599},
  year   = {2023}
}