中文

“Liar, Liar Pants on Fire”:用于假新闻检测的新基准数据集

计算与语言 2017-05-03 v1 计算机与社会

摘要

自动假新闻检测是欺骗检测中的一个挑战性问题,具有巨大的现实政治与社会影响。然而,统计方法应对假新闻受到缺乏标注基准数据集的极大限制。本文中,我们提出 liar:一个用于假新闻检测的新的公开可用数据集。我们从 PolitiFact.com 收集了十年间、12.8K 条手动标注的多种情境下的短陈述,该网站为每个案例提供详细分析报告和源文档链接。该数据集也可用于事实核查研究。值得注意的是,该新数据集比先前同类最大的公共假新闻数据集大一个数量级。我们基于表层语言模式实证研究了自动假新闻检测。我们设计了一种新颖的混合卷积神经网络,将元数据与文本集成。我们表明这种混合方法可以改进仅文本的深度学习模型。

关键词

引用

@article{arxiv.1705.00648,
  title  = {"Liar, Liar Pants on Fire": A New Benchmark Dataset for Fake News Detection},
  author = {William Yang Wang},
  journal= {arXiv preprint arXiv:1705.00648},
  year   = {2017}
}

备注

ACL 2017