基于弱监督因果解耦的跨平台仇恨言论检测
机器学习
2024-04-18 v1 计算与语言
摘要
内容 moderation 面临的挑战在于,社交媒体的传播仇恨言论的能力与其促进全球连接的作用并存。随着口语和仇恨言论的快速演变,传统深度学习对在线对话中流动性格局的适应性仍有限。为此,受因果启发的解耦方法显示出通过分离平台特定的独特之处与普遍仇恨指标的希望。然而,其对明确目标标签依赖以辨别这些细微差别,在平台不断演变和仇恨言论的可变性这两个实际障碍下受到限制。通过基于置信度的重加权和对比正则化,本研究提出了一种名为HATE WATCH的新型弱监督因果解耦框架,以规避明确目标标记的需求,有效地将输入特征解耦为仇恨的不变表示。经验验证显示,HATE WATCH 在带有目标标签和不带目标标签的两个平台上均表现出色,将其定位为跨平台仇恨言论检测的新方法。HATE WATCH 推动了可扩展的内容 moderation 技术向发展更安全的在线社区迈进。
引用
@article{arxiv.2404.11036,
title = {Cross-Platform Hate Speech Detection with Weakly Supervised Causal Disentanglement},
author = {Paras Sheth and Tharindu Kumarage and Raha Moraffah and Aman Chadha and Huan Liu},
journal= {arXiv preprint arXiv:2404.11036},
year = {2024}
}