中文

一种绕过 Twitter API 限制的网页抓取方法

信息检索 2018-03-28 v1

摘要

从社交网络中检索信息是自然语言处理、情感分析和机器学习等许多数据分析领域的首要且最基础的步骤。重要的数据科学任务依赖于历史数据收集以获得进一步的预测结果。最近的许多工作使用 Twitter API,这是一个用于收集公共信息流的公共平台,允许查询不超过三周的按时间排序的推文。在本文中,我们提出了一种新方法,使用网页抓取技术收集任意日期范围内的历史推文,从而绕过 Twitter API 的限制。

关键词

引用

@article{arxiv.1803.09875,
  title  = {A Web Scraping Methodology for Bypassing Twitter API Restrictions},
  author = {A. Hernandez-Suarez and G. Sanchez-Perez and K. Toscano-Medina and V. Martinez-Hernandez and V. Sanchez and H. Perez-Meana},
  journal= {arXiv preprint arXiv:1803.09875},
  year   = {2018}
}