中文

面向仇恨言论检测的群体特定 NLP 方法

计算与语言 2023-04-25 v1

摘要

自动仇恨言论检测是一项重要而复杂的任务,需要常识、受保护群体的刻板印象以及歧视历史等方面的知识,且每一方面都可能持续演变。在本文中,我们提出一种面向在线仇恨言论检测的群体特定 NLP 方法。该方法包括:将关于特定受保护群体的历史与语言知识创建并注入仇恨言论检测模型;分析针对某受保护群体的歧视历史数据以更好地预测针对该群体的仇恨言论激增;以及通过交叉性与伦理的视角批判性地评估仇恨言论检测模型。我们通过一项关于反犹太仇恨言论检测 NLP 的案例研究来展示该方法。该案例研究综合了当前关于反犹太主义检测 NLP 的英文文献,引入了从 20 世纪至今的反犹太历史与语言新颖知识图谱,将知识图谱中的信息注入到一组推文上基于 Logistic Regression 与 uncased DistilBERT 基线的模型中,并指出融入知识图谱的语境可帮助模型捕捉细微的刻板印象。

关键词

引用

@article{arxiv.2304.11223,
  title  = {A Group-Specific Approach to NLP for Hate Speech Detection},
  author = {Karina Halevy},
  journal= {arXiv preprint arXiv:2304.11223},
  year   = {2023}
}

备注

11 pages, 0 figures