中文

用于爬取主题相关假新闻语料的相似性检测流水线

计算与语言 2021-03-02 v2 信息检索

摘要

假新闻检测是一项旨在减少人工核查新闻真实性所需时间与精力的挑战性任务。然而,自动化应对假新闻的方法受限于缺乏标注基准数据集,尤其是英语以外的语言。此外,许多公开可用语料具有特定局限性,难以使用。针对此问题,我们的贡献有三方面。首先,我们提出一个新的、公开可用的德语主题相关假新闻检测语料。据我们所知,这是此类首个语料。为此,我们开发了一条用于爬取相似新闻文章的流水线。作为第三方面贡献,我们进行了不同的学习实验以检测假新闻。最佳性能通过使用 SBERT 的句子级嵌入结合 Bi-LSTM 取得(k=0.88)。

关键词

引用

@article{arxiv.2009.13367,
  title  = {Similarity Detection Pipeline for Crawling a Topic Related Fake News Corpus},
  author = {Inna Vogel and Jeong-Eun Choi and Meghana Meghana},
  journal= {arXiv preprint arXiv:2009.13367},
  year   = {2021}
}

备注

Further development done