中文

可解释仇恨言论检测中的组合泛化

计算与语言 2025-06-05 v1

摘要

仇恨言论检测是在线内容审核的关键任务,但当前模型在其训练数据之外的泛化能力有限。这被关联到数据偏差以及使用句子级标签的问题,这些标签未能教会模型仇恨言论的底层结构。本文我们展示,即使在模型使用更细粒度的片段级注释进行训练时(例如,“artist”被标记为目标,“are parasites”被标记为非人化比较),它们仍然难以将这些注释的含义与周围上下文区分开来。结果是,与训练期间看到的表达组合起来在模型检测方面仍然具有挑战性。我们研究在表达式在所有上下文中出现频率相等的情况下进行训练是否可以提高泛化能力。为此,我们创建了U-PLEAD,一个包含约364,000个合成帖子的数据集,以及一个约8,000个手动验证帖子的新型组合泛化基准。训练时将U-PLEAD与真实数据相结合,可在保持对人类来源PLEAD的最新性能的同时提高组合泛化。

关键词

引用

@article{arxiv.2506.03916,
  title  = {Compositional Generalisation for Explainable Hate Speech Detection},
  author = {Agostina Calabrese and Tom Sherborne and Björn Ross and Mirella Lapata},
  journal= {arXiv preprint arXiv:2506.03916},
  year   = {2025}
}