中文

用于学习干预在线仇恨言论的基准数据集

计算与语言 2019-09-11 v1 人工智能 计算机与社会

摘要

应对在线仇恨言论是一项关键但具有挑战性的任务,但可以借助自然语言处理(NLP)技术来辅助。以往的研究主要关注开发 NLP 方法来自动有效地检测在线仇恨言论,而忽视了未来平息和劝阻个人使用仇恨言论所需的进一步行动。此外,大多数现有的仇恨言论数据集将每条帖子视为孤立实例,忽略了对话上下文。在本文中,我们提出了一种新颖的生成式仇恨言论干预任务,其目标是自动生成回应,以在包含仇恨言论的在线对话中进行干预。作为该工作的一部分,我们引入了从 Gab 和 Reddit 收集的两个完全标注的大规模仇恨言论干预数据集。这些数据集提供了对话片段、仇恨言论标签,以及由 Mechanical Turk Workers 撰写的干预回应。在本文中,我们还分析了这些数据集以理解常见的干预策略,并探索了常见自动回应生成方法在这些新数据集上的性能,从而为未来研究提供基准。

关键词

引用

@article{arxiv.1909.04251,
  title  = {A Benchmark Dataset for Learning to Intervene in Online Hate Speech},
  author = {Jing Qian and Anna Bethke and Yinyin Liu and Elizabeth Belding and William Yang Wang},
  journal= {arXiv preprint arXiv:1909.04251},
  year   = {2019}
}