中文

面向数据收集的人机协同:用于对抗网络仇恨言论的多目标反叙事数据集

计算与语言 2021-09-21 v1 计算机与社会

摘要

以知情且非攻击性的回应(称为反叙事)来削弱仇恨内容的影响,已成为构建更健康在线社区的一种可能方案。因此,一些自然语言处理(NLP)研究已开始着手反叙事生成任务。尽管这些研究努力构建了用于神经生成的仇恨言论/反叙事(HS/CN)数据集,但它们在达到高质量和/或高数量方面存在不足。在本文中,我们提出了一种新颖的人机协同数据收集方法,其中生成式语言模型通过使用前一循环中的自身数据来迭代精炼,以生成供专家审阅和/或后编辑的新训练样本。我们的实验包含多个带有动态变化的循环。结果表明该方法具有可扩展性,并有助于多样、新颖且经济高效的数据收集。据我们所知,所得数据集是社区中唯一基于专家的多目标 HS/CN 数据集。

关键词

引用

@article{arxiv.2107.08720,
  title  = {Human-in-the-Loop for Data Collection: a Multi-Target Counter Narrative Dataset to Fight Online Hate Speech},
  author = {Margherita Fanton and Helena Bonaldi and Serra Sinem Tekiroglu and Marco Guerini},
  journal= {arXiv preprint arXiv:2107.08720},
  year   = {2021}
}

备注

To appear at ACL 2021 (long paper)