中文

利用 Transformer 推进仇恨言论检测:来自 MetaHate 的洞见

机器学习 2025-08-08 v1 计算与语言

摘要

仇恨言论是一种广泛且有害的网络语言形式,包含侮辱性话语和抹黑帖子,可能对受目标影响的个人和社区造成严重的社会、心理乃至身体层面的影响。随着 X(前身为 Twitter)、Facebook、Instagram、Reddit 等社交媒体平台继续推动广泛沟通,它们也成为仇恨言论的滋生土壤,而仇恨言论正日益与现实世界的仇恨犯罪相关联。解决此问题需要开发针对多样化社交媒体环境中仇恨言论检测的稳健自动化方法。深度学习方法,如基础循环神经网络(RNN)、长短期记忆网络(LSTM)和卷积神经网络(CNN),已取得良好成绩,但常受长期依赖关系和效率并行化不足的限制。本研究代表了对基于 Transformer 的仇恨言论检测方法的全面探索,使用 MetaHate 数据集——该数据集包含 36 个子数据集,涵盖 120 万条社交媒体样本。我们评估了多种最先进的 Transformer 模型,包括 BERT、RoBERTa、GPT-2 和 ELECTRA,其中经过微调的 ELECTRA 取得最高性能(F1 分数:0.8980)。我们还分析了分类错误,揭示了对讽刺、隐性语言以及标签噪声的挑战。

关键词

引用

@article{arxiv.2508.04913,
  title  = {Advancing Hate Speech Detection with Transformers: Insights from the MetaHate},
  author = {Santosh Chapagain and Shah Muhammad Hamdi and Soukaina Filali Boubrahimi},
  journal= {arXiv preprint arXiv:2508.04913},
  year   = {2025}
}

备注

Accepted to the Deviant Dynamics in Digital Spaces workshop at ASONAM 2025