一种绕过 Twitter API 限制的网页抓取方法
信息检索
2018-03-28 v1
摘要
从社交网络中检索信息是自然语言处理、情感分析和机器学习等许多数据分析领域的首要且最基础的步骤。重要的数据科学任务依赖于历史数据收集以获得进一步的预测结果。最近的许多工作使用 Twitter API,这是一个用于收集公共信息流的公共平台,允许查询不超过三周的按时间排序的推文。在本文中,我们提出了一种新方法,使用网页抓取技术收集任意日期范围内的历史推文,从而绕过 Twitter API 的限制。
关键词
引用
@article{arxiv.1803.09875,
title = {A Web Scraping Methodology for Bypassing Twitter API Restrictions},
author = {A. Hernandez-Suarez and G. Sanchez-Perez and K. Toscano-Medina and V. Martinez-Hernandez and V. Sanchez and H. Perez-Meana},
journal= {arXiv preprint arXiv:1803.09875},
year = {2018}
}