中文

PEACE:跨平台仇恨言论检测——一种因果引导框架

计算与语言 2023-10-10 v2 机器学习

摘要

仇恨言论检测指检测旨在基于宗教、性别、性取向或其他特征诋毁个人或群体的仇恨内容的任务。由于各平台政策不同,不同群体以不同方式表达仇恨。此外,由于某些平台缺乏标注数据,构建仇恨言论检测模型变得具有挑战性。为此,我们重新审视能否为跨平台设定学习一个可泛化的仇恨言论检测模型,即在某一(源)平台数据上训练模型并泛化至多个(目标)平台。现有泛化模型依赖语言线索或辅助信息,使其偏向于源平台上的特定标签或特定词汇(如辱骂性词语),从而不适用于目标平台。受社会与心理学理论启发,我们致力于探索是否存在固有因果线索可用于学习跨这些分布偏移检测仇恨言论的泛化表示。为此,我们提出一种因果引导框架 PEACE,其识别并利用仇恨内容中普遍存在的两种内在因果线索:文本中的整体情感与攻击性。我们在多个平台(代表分布偏移)上进行了广泛实验,以展示因果线索是否能助力跨平台泛化。

关键词

引用

@article{arxiv.2306.08804,
  title  = {PEACE: Cross-Platform Hate Speech Detection- A Causality-guided Framework},
  author = {Paras Sheth and Tharindu Kumarage and Raha Moraffah and Aman Chadha and Huan Liu},
  journal= {arXiv preprint arXiv:2306.08804},
  year   = {2023}
}

备注

ECML PKDD 2023