英文文本仇恨言论多标签分类的机器学习模型与数据集综述
计算与语言
2025-04-14 v1 人工智能
摘要
网络仇恨言论的传播可能对个人、在线社区乃至整个社会产生严重的负面影响。鉴于仇恨内容的庞大数量,促使从事内容审查或执法的从业者以及研究者关注使用机器学习模型自动对仇恨言论进行分类。虽然大多数科学工作将仇恨言论分类视为二分类任务,但实际应用中常需区分子类型(例如根据目标、严重程度或合法性),这可能导致单个内容具有重叠。因此,研究者创建了数据集和机器学习模型,将仇恨言论分类作为多标签问题来处理。本工作综述了针对英文语境中这一新兴研究领域的系统性和全面性文献(N=46)。我们提供了28个适用于训练多标签分类模型的数据集的简要概述,揭示了关于标签集、规模、元概念、标注过程以及标注员间一致性的显著异质性。我们分析了24篇提出合适分类模型的论文,进一步表明评估方法的不一致性以及对基于双向编码器表示从变换(BERT)和循环神经网络(RNN)架构的偏好。我们确定了训练数据不平衡、依赖众包平台、数据集小且稀疏以及缺乏方法论一致性作为关键开放问题,并提出十项研究建议。
引用
@article{arxiv.2504.08609,
title = {A Survey of Machine Learning Models and Datasets for the Multi-label Classification of Textual Hate Speech in English},
author = {Julian Bäumler and Louis Blöcher and Lars-Joel Frey and Xian Chen and Markus Bayer and Christian Reuter},
journal= {arXiv preprint arXiv:2504.08609},
year = {2025}
}
备注
35 pages, 4 figures, 4 tables