基于最大集合覆盖方法的Twitter主题分类器搜索API查询优化
信息检索
2020-01-28 v2
摘要
Twitter已发展成为获取重大事件和动态话题即时信息的重要平台。例如,近期工作表明,训练用于检测Twitter上主题内容的分类器可以很好地泛化到训练数据之外。由于对Twitter数据的访问隐藏在受限的搜索API之后,大多数用户无法直接将这些分类器应用于Twitter未过滤的数据流(“firehose”)。相反,应用必须首先通过搜索API决定检索哪些内容,再用主题分类器对该内容进行过滤。因此,相对于预期的主题分类器查询Twitter API时,以最小化检索到的被负分类数据量至关重要。本文中,我们提出了一系列查询优化方法,将最大覆盖问题的概念推广,以在API限制内找到覆盖大部分主题相关推文且不牺牲精度的查询词子集。我们在一个大型Twitter数据集上评估了所提方法,该数据集于2013和2014年收集,使用人工策划的八个话题标签进行标注。在诸多见解中,我们的分析表明,所提方法中最佳者能在严格API限制下以高召回率显著优于firehose的精度和F1-score。
引用
@article{arxiv.1904.10403,
title = {Optimizing Search API Queries for Twitter Topic Classifiers Using a Maximum Set Coverage Approach},
author = {Kasra Safari and Scott Sanner},
journal= {arXiv preprint arXiv:1904.10403},
year = {2020}
}