ChildGuard:针对针对儿童定向仇恨言论的专用数据集
计算与语言
2025-07-29 v2 声音
音频与语音处理
摘要
针对儿童的仇恨言论在社交媒体上是一项严重且日益严重的问题,但现有NLP系统在检测方面效果不佳。这一差距主要是因为现有数据集聚焦成人,缺乏年龄特定标签,遗漏细微语言线索,且数据规模往往不足以支撑稳健的建模。为此,本文引入ChildGuard,首个专注于针对儿童仇恨言论的大规模英文数据集。它包含351,877个来自X(前身为Twitter)、Reddit和YouTube的标注实例,按三个年龄组标注:幼儿(11岁以下)、初中生(11-12岁)和青少年(13-17岁)。数据集分为两个子集用于细粒度分析:情境子集(157K)侧重话语层面特征,词汇子集(194K)侧重词汇层面的情感和词汇。对ChildGuard上先进仇恨言论模型进行基准测试显示,性能显著下降,凸显了检测儿童定向仇恨言论的挑战。
引用
@article{arxiv.2506.21613,
title = {ChildGuard: A Specialized Dataset for Combatting Child-Targeted Hate Speech},
author = {Gautam Siddharth Kashyap and Mohammad Anas Azeez and Rafiq Ali and Zohaib Hasan Siddiqui and Jiechao Gao and Usman Naseem},
journal= {arXiv preprint arXiv:2506.21613},
year = {2025}
}
备注
Updated Version