中文

用于跨平台仇恨言论检测的因果引导解耦

计算与语言 2023-12-12 v3 机器学习

摘要

社交媒体平台虽促进了开放讨论,却常被利用来传播有害内容。当前用于检测此类有害内容的深度学习与自然语言处理模型过度依赖特定领域术语,影响了其适应可泛化仇恨言论检测的能力。这是因为它们往往过于关注特定的语言信号或某些类别词汇的使用。当平台缺乏用于训练的高质量标注数据时,会出现另一重大挑战,从而需要能够适应不同分布偏移的跨平台模型。我们的研究提出了一种跨平台仇恨言论检测模型,可在某一平台数据上训练并泛化至多个未见平台。为获得良好的跨平台泛化能力,一种方法是将输入表示解耦为不变特征与平台相关特征。我们还认为,学习在不同环境中保持恒定的因果关系,可显著有助于理解仇恨言论中的不变表示。通过将输入解耦为平台相关特征(用于预测仇恨目标)与平台无关特征(用于预测仇恨存在),我们学习到对分布偏移具有鲁棒性的不变表示。这些特征随后被用于预测未见平台上的仇恨言论。我们在四个平台上的大量实验表明,与现有最先进(SOTA)方法相比,我们的模型在检测泛化仇恨言论方面更为有效。

关键词

引用

@article{arxiv.2308.02080,
  title  = {Causality Guided Disentanglement for Cross-Platform Hate Speech Detection},
  author = {Paras Sheth and Tharindu Kumarage and Raha Moraffah and Aman Chadha and Huan Liu},
  journal= {arXiv preprint arXiv:2308.02080},
  year   = {2023}
}

备注

Accepted to WSDM'24