社交媒体中鲁棒的仇恨言论检测:一项跨数据集实证评估
计算与语言
2023-07-06 v1
摘要
在线仇恨言论的自动检测是 NLP 中的一个活跃研究领域。迄今为止大多数研究基于社交媒体数据集,这些数据集有助于创建在其上训练的仇恨言论检测模型。然而,数据创建过程包含其自身的偏差,且模型不可避免地从这些数据集特定的偏差中学习。在本文中,我们执行了一项大规模跨数据集比较,在不同仇恨言论检测数据集上微调语言模型。该分析显示了某些数据集作为训练数据时比其他数据集更具泛化性。关键的是,我们的实验显示了结合仇恨言论检测数据集如何有助于鲁棒仇恨言论检测模型的开发。即便在控制数据规模并与最佳单一数据集比较时,这种鲁棒性依然成立。
引用
@article{arxiv.2307.01680,
title = {Robust Hate Speech Detection in Social Media: A Cross-Dataset Empirical Evaluation},
author = {Dimosthenis Antypas and Jose Camacho-Collados},
journal= {arXiv preprint arXiv:2307.01680},
year = {2023}
}
备注
Accepted in "Workshop on Online Abuse and Harms (WOAH)", 2023