中文

解构目标身份上的仇恨表达

计算与语言 2024-10-15 v1 人工智能

摘要

仇恨言语(Hate Speech,HS)分类器在检测针对不同目标身份的仇恨表达时表现不一,还会显示出系统性偏见。我们借助两个最近提出的功能性测试数据集,对不同因素对HS预测的影响进行量化分析。实验表明,HS检测器仅凭提到特定目标身份就会赋予更高的仇恨评分。此外,模型常常混淆仇恨程度与情感极性。这一结果令人担忧,因为我们努力构建的HS检测器可能伤害我们希望保护的弱势身份群体:表达愤怒或不满仇恨表达意见的帖子可能被误判为仇恨。我们还受社会心理学理论启发,发现仇恨程度预测的准确性与刻板印象强度密切相关。

关键词

引用

@article{arxiv.2410.10332,
  title  = {Disentangling Hate Across Target Identities},
  author = {Yiping Jin and Leo Wanner and Aneesh Moideen Koya},
  journal= {arXiv preprint arXiv:2410.10332},
  year   = {2024}
}