中文

假新闻数据收集与分类:基于伪相关反馈的不透明搜索引擎迭代查询选择

信息检索 2021-02-23 v2

摘要

从在线搜索引擎检索信息是许多数据挖掘任务中首要且最关键的一步。当前网络上大多数可用的搜索引擎,包括所有社交媒体平台,都是支持短关键词查询的黑盒(亦称不透明)。在这些设定下,自动大规模检索讨论某一特定新闻条目的所有帖子和评论是一项具有挑战性的任务。本文中,我们提出一种给定原型文档生成短关键词查询的方法。所提出的迭代查询选择算法(IQS)与不透明搜索引擎交互以迭代地改进查询。它在 Twitter TREC Microblog 2012 和 TREC-COVID 2019 数据集上进行了评估,显示出优于最先进方法的性能。IQS 被应用于自动收集一个约 70K 真新闻与假新闻条目的大规模假新闻数据集。该数据集公开供研究使用,包含超过 22M 个账户和 61M 条 Twitter 批准格式的推文。我们展示了该数据集在假新闻检测任务中的有用性,取得了最先进的性能。

关键词

引用

@article{arxiv.2012.12498,
  title  = {Fake News Data Collection and Classification: Iterative Query Selection for Opaque Search Engines with Pseudo Relevance Feedback},
  author = {Aviad Elyashar and Maor Reuben and Rami Puzis},
  journal= {arXiv preprint arXiv:2012.12498},
  year   = {2021}
}