面向隐式仇恨言论检测的通用可泛化有害言论数据集
计算与语言
2025-06-23 v1 人工智能
机器学习
摘要
隐式仇恨言论最近成为社交媒体平台的关键挑战。虽然此前研究主要关注一般有害言论,但针对隐蔽和微妙形式仇恨的通用检测技术需求日益迫切。基于词典分析,我们假设隐式仇恨言论已经存在于公开的有害言论数据集中,但可能未被注释者明确识别或标记。此外,众所周知,众包数据集容易因任务的复杂性和注释者主观解释的影响而产生误标。在本文中,我们提出了一种方法来解决隐式仇恨言论检测问题,并通过利用现有的有害言论数据集来提高其跨数据集的泛化性。该方法包含三个关键组件:影响样本识别、重新标注和使用 Llama-3 70B 和 GPT-4o 进行数据增强。实验结果表明,我们的方法在提高隐式仇恨检测方面有效,相较于基线实现了 12.9 分的 F1 分数提升。
引用
@article{arxiv.2506.16476,
title = {Towards Generalizable Generic Harmful Speech Datasets for Implicit Hate Speech Detection},
author = {Saad Almohaimeed and Saleh Almohaimeed and Damla Turgut and Ladislau Bölöni},
journal= {arXiv preprint arXiv:2506.16476},
year = {2025}
}