中文

通过支持标注者改进对抗性数据收集:来自德国仇恨言论数据集GAHD的经验教训

计算与语言 2024-03-29 v1

摘要

仇恨言论检测模型的好坡,取决于其训练的数据质量。来自社交媒体的数据集存在系统性缺口和偏见,导致模型不可靠且决策边界简单粗糙。对抗性数据集通过利用模型弱点收集,旨在解决这一问题。然而,对抗性数据收集可能缓慢且昂贵,单个标注者的创造力有限。本文介绍GAHD(German Adversarial Hate speech Dataset,德语对抗性仇恨言论数据集),一个包含约11k个样本的新型德语仇恨言论数据集。在数据收集过程中,我们探索了支持标注者的新策略,以更高效地创建更具多样性的对抗性样本,并对每种策略的标注者 disagreement进行手动分析。我们的实验表明,所得数据集即使对最先进的仇恨言论检测模型也具有挑战性,训练使用GAHD可明显提高模型的鲁棒性。进一步地,我们发现混合多种支持策略最为有利。我们在https://github.com/jagol/gahd公开GAHD。

关键词

引用

@article{arxiv.2403.19559,
  title  = {Improving Adversarial Data Collection by Supporting Annotators: Lessons from GAHD, a German Hate Speech Dataset},
  author = {Janis Goldzycher and Paul Röttger and Gerold Schneider},
  journal= {arXiv preprint arXiv:2403.19559},
  year   = {2024}
}

备注

Accepted at NAACL 2024 (main conference)