中文

重新审视仇恨言论基准:从数据构建到系统部署

计算与语言 2023-06-16 v2

摘要

社交媒体充斥着仇恨内容,其中大量内容常借助语言和主题的多样性进行掩饰。用于仇恨言论检测的基准数据集主要通过仇恨词表编纂,并未考虑此类偏离现象。然而,在中性播种的恶意内容中捕捉仇恨信号变得具有挑战性。因此,设计能够模拟现实世界中仇恨多变性的模型与数据集值得进一步研究。为此,我们提出 GOTHate,一个来自 Twitter 的约 5.1 万条帖子的规模化多语众包仇恨言论检测数据集。GOTHate 采用中性播种,涵盖不同语言与主题。我们对 GOTHate 与现有仇恨言论数据集进行了详细比较,凸显其新颖性。我们使用 10 个近期基线模型对其进行基准测试。广泛的实证与基准实验表明,GOTHate 在纯文本设置下难以分类。因此,我们探究添加内源信号如何增强仇恨言论检测任务。我们用用户的时间线信息与自我网络扩充 GOTHate,使整体数据来源更贴近理解仇恨内容的现实设置。我们提出的方案 HEN-mBERT 是一种模块化、多语言、混合专家模型,利用来自历史、拓扑与范例的潜在内源信号丰富语言子空间。HEN-mBERT 在整体宏 F1 与仇恨类 F1 上分别超越最佳基线 2.5% 与 5%。受实验启发,我们与 Wipro AI 合作,正在开发半自动化流水线以检测仇恨内容,作为其应对网络危害使命的一部分。

关键词

引用

@article{arxiv.2306.01105,
  title  = {Revisiting Hate Speech Benchmarks: From Data Curation to System Deployment},
  author = {Atharva Kulkarni and Sarah Masud and Vikram Goyal and Tanmoy Chakraborty},
  journal= {arXiv preprint arXiv:2306.01105},
  year   = {2023}
}

备注

15 pages, 4 figures, 11 tables. Accepted at SIGKDD'23