用于学习干预在线仇恨言论的基准数据集
计算与语言
2019-09-11 v1 人工智能
计算机与社会
摘要
应对在线仇恨言论是一项关键但具有挑战性的任务,但可以借助自然语言处理(NLP)技术来辅助。以往的研究主要关注开发 NLP 方法来自动有效地检测在线仇恨言论,而忽视了未来平息和劝阻个人使用仇恨言论所需的进一步行动。此外,大多数现有的仇恨言论数据集将每条帖子视为孤立实例,忽略了对话上下文。在本文中,我们提出了一种新颖的生成式仇恨言论干预任务,其目标是自动生成回应,以在包含仇恨言论的在线对话中进行干预。作为该工作的一部分,我们引入了从 Gab 和 Reddit 收集的两个完全标注的大规模仇恨言论干预数据集。这些数据集提供了对话片段、仇恨言论标签,以及由 Mechanical Turk Workers 撰写的干预回应。在本文中,我们还分析了这些数据集以理解常见的干预策略,并探索了常见自动回应生成方法在这些新数据集上的性能,从而为未来研究提供基准。
引用
@article{arxiv.1909.04251,
title = {A Benchmark Dataset for Learning to Intervene in Online Hate Speech},
author = {Jing Qian and Anna Bethke and Yinyin Liu and Elizabeth Belding and William Yang Wang},
journal= {arXiv preprint arXiv:1909.04251},
year = {2019}
}