HateXplain:一个用于可解释仇恨言论检测的基准数据集
计算与语言
2022-04-13 v2 人工智能
社会与信息网络
摘要
仇恨言论是困扰在线社交媒体的一项严峻挑战。尽管针对仇恨言论检测的更优模型不断被开发,关于仇恨言论的偏差与可解释性方面的研究却很少。本文中,我们引入HateXplain,首个涵盖该问题多个层面的基准仇恨言论数据集。我们数据集中每篇帖子均从三个不同视角标注:基础的、常用的3类分类(即仇恨、攻击性或正常),目标社区(即帖子中成为仇恨/攻击性言论受害者的社区),以及理由,即帖子中支撑其标注决策(仇恨、攻击性或正常)的部分。我们利用现有的最先进模型并观察到,即便在分类上表现极佳的模型,在模型合理性与忠实度等可解释性指标上得分也不高。我们还观察到,利用人工理由训练的模型在降低对目标社区的非预期偏差方面表现更好。我们已将代码与数据集公开于 https://github.com/punyajoy/HateXplain。
引用
@article{arxiv.2012.10289,
title = {HateXplain: A Benchmark Dataset for Explainable Hate Speech Detection},
author = {Binny Mathew and Punyajoy Saha and Seid Muhie Yimam and Chris Biemann and Pawan Goyal and Animesh Mukherjee},
journal= {arXiv preprint arXiv:2012.10289},
year = {2022}
}
备注
12 pages, 7 figues, 8 tables. Accepted at AAAI 2021