HateDay:来自 Twitter 某日全球仇恨言论数据集的洞见
计算与语言
2025-06-04 v3
摘要
为解决线上仇恨言论的全球性挑战, prior research 开发了检测模型以标记社交媒体中的仇恨内容。然而,由于 evaluation 数据集中存在 system bias,实际效果尚不明了,尤其在不同地区。我们引入 HateDay,首个代表社交媒体环境的全球仇恨言论数据集,由对 2022 年 9 月 21 日所有推文进行随机抽样构建,覆盖八种语言及四个英语国家。使用 HateDay,我们发现仇恨言论在不同语言和地区的流行程度及组成存在 substantial variation。我们表明, academic 数据集上的 evaluation 严重高估了实际检测性能,实际表现极低,尤其针对 non-European 语言。我们的分析识别出这一差距的关键驱动因素,包括模型难以区分仇恨言论与冒犯性言论,以及 academic 数据集中强调的目标群体与实际中最常受针对的群体之间存在 mismatch。我们认为, poor model performance 使得 public 模型不适合用于自动仇恨言论 moderation,发现仅凭 human oversight 可实现 high moderation rates。我们的结果强调,需在反映真实社交媒体复杂性与多样性的数据上评估检测系统。
关键词
引用
@article{arxiv.2411.15462,
title = {HateDay: Insights from a Global Hate Speech Dataset Representative of a Day on Twitter},
author = {Manuel Tonneau and Diyi Liu and Niyati Malhotra and Scott A. Hale and Samuel P. Fraiberger and Victor Orozco-Olvera and Paul Röttger},
journal= {arXiv preprint arXiv:2411.15462},
year = {2025}
}
备注
ACL 2025 main conference. Data available at https://huggingface.co/datasets/manueltonneau/hateday