中文

WAC:用于在线滥用检测的中文维基百科对话语料库

计算与语言 2021-01-19 v1

摘要

随着在线社交网络的扩散,监控所有用户生成内容变得越来越困难。因此,自动化审核互联网上不当交流内容的过程已成为一项优先任务。为此已提出多种方法,但找到合适的数据集来训练和开发这些方法可能具有挑战性。对于基于对话结构和动态信息的方法而言,这一问题尤为突出。在本工作中,我们提出了一个基于维基百科评论语料库的原创框架,带有不同类别的评论级滥用标注。与现有仅关注孤立消息(即脱离对话上下文)的语料库相比,主要贡献在于对话的重建。这一包含超过38万条标注消息的大型语料库为在线滥用检测尤其是基于上下文的方法开辟了前景。除该语料库外,我们还提出了一个完整的基准测试平台,以激励并公平比较围绕内容滥用检测问题的科学工作,试图避免结果复现的反复出现问题。最后,我们将两种分类方法应用于我们的数据集以展示其潜力。

关键词

引用

@article{arxiv.2003.06190,
  title  = {WAC: A Corpus of Wikipedia Conversations for Online Abuse Detection},
  author = {Noé Cecillon and Vincent Labatut and Richard Dufour and Georges Linares},
  journal= {arXiv preprint arXiv:2003.06190},
  year   = {2021}
}