中文

利用语义子空间对社交媒体中的亵渎与仇恨言论进行建模

计算与语言 2021-06-21 v2

摘要

由于任务的主观性以及现有语料库标注的不兼容性,仇恨言论与亵渎检测面临数据稀疏问题,尤其对于英语以外的语言而言。在本研究中,我们在词与句子表示中识别出亵渎子空间,并探索其在零样本设定下对一系列相似与疏远目标任务的泛化能力。该过程以单语(德语)及跨语言方式展开,目标语言包括紧密相关的(英语)、疏远相关的(法语)以及不相关的(阿拉伯语)。我们观察到,在相似与疏远目标任务上且跨所有语言中,基于子空间的表示在零样本设定下比标准 BERT 表示迁移更有效,在所有测试的单语与跨语言场景下相较基线取得 F1 +10.9 至 F1 +42.9 的提升。

关键词

引用

@article{arxiv.2106.07505,
  title  = {Modeling Profanity and Hate Speech in Social Media with Semantic Subspaces},
  author = {Vanessa Hahn and Dana Ruiter and Thomas Kleinbauer and Dietrich Klakow},
  journal= {arXiv preprint arXiv:2106.07505},
  year   = {2021}
}

备注

9 pages, 4 figures, accepted as a long paper at Workshop on Online Abuse and Harms 2021