基于因果引导的跨风格仇恨言论检测表示学习
计算与语言
2026-02-04 v2 人工智能
机器学习
摘要
在线仇恨言论的不断扩散对网络和谐气构成重大威胁。虽然通过明显的侮辱词汇容易被识别,但隐性仇恨言论往往通过讽刺、反讽、刻板印象或暗示性语言表达,因而难以检测。现有的仇恨言论检测模型主要依赖表层语言线索,难以在多样化的风格变异上获得良好泛化。此外,仇恨言论在不同平台上常针对不同群体并采取独特风格,可能在目标与标签之间引入虚假关联,这进一步挑战了当前的检测方法。基于上述观察,我们假设仇恨言论的生成可建模为涉及关键因素:情境环境、创作者动机、目标和风格的因果图。受该图指导,我们提出了 CADET—a causal representation learning 框架,通过解耦仇恨言论为可解释的潜在因素并控制混杂因素,从而隔离出真实的仇恨意图,净化语言线索。此外,CADET 允许在潜在空间中对风格进行反事实推理,自然引导模型在不同形式下稳健识别仇恨言论。CADET 在全面实验中显示出优异性能,凸显了因果先验在推进通用仇恨言论检测方面的潜力。
引用
@article{arxiv.2510.07707,
title = {Causality Guided Representation Learning for Cross-Style Hate Speech Detection},
author = {Chengshuai Zhao and Shu Wan and Paras Sheth and Karan Patwa and K. Selçuk Candan and Huan Liu},
journal= {arXiv preprint arXiv:2510.07707},
year = {2026}
}
备注
Accepted by the ACM Web Conference 2026 (WWW 26)