中文

数据饥饿下的性别歧视检测

计算与语言 2024-06-10 v1

摘要

随着社交媒体使用量的增加,线上仇恨言论的扩散也随之上升。为此,亦推出了大量基于自然语言处理和深度学习的方法,用于自动识别有害文本内容。虽然训练深度学习模型需要大量标注数据,但近期研究表明,在特定数据子集上训练的模型仍可保持与在完整数据集上训练的模型相当的性能。本文展示如何利用影响分数在训练模型时估计数据点的重要性,并设计一种用于性别歧视检测的数据修剪策略。我们在三个跨域数据集上评估了使用不同修剪策略训练的模型性能,发现与其他工作一致的是,大量样本可被移除而不显著影响性能。然而,我们也发现,此前在自然语言推理任务中成功的数据修剪策略并不适用于有害内容检测,反而会进一步放大现存的类别不平衡,最坏情况下导致仇恨类别完全消失。

关键词

引用

@article{arxiv.2406.04892,
  title  = {Sexism Detection on a Data Diet},
  author = {Rabiraj Bandyopadhyay and Dennis Assenmacher and Jose M. Alonso Moral and Claudia Wagner},
  journal= {arXiv preprint arXiv:2406.04892},
  year   = {2024}
}

备注

Accepted at ACM WebSci 2024 Workshop in DHOW: Diffusion of Harmful Content on Online Web Workshop