中文

智能爬取:一种基于 Twitter 的聚焦爬取新方法

信息检索 2021-10-13 v1 人工智能 机器学习 社会与信息网络

摘要

Twitter 是一个社交网络,提供了丰富且有趣、难以检索与分析的信息源。Twitter 数据可通过 REST API 访问。现有操作允许基于一组关键词检索推文,但存在诸如每分钟调用次数与结果大小等限制。此外,对检索结果无法控制,且找到与特定主题相关的推文是一大难题。鉴于这些限制,查询关键词须明确覆盖感兴趣的主题,以同时获得相关结果并减少 API 调用次数。本文中,我们引入一种称为“SmartTwitter Crawling”(STiC)的新爬取算法,用于检索与目标主题相关的一组推文。该算法中,我们取初始关键词查询,并利用来自不同数据源的一组附加关键词对其进行扩充。STiC 算法依赖于 Twittergraph 中的 DFS 搜索,其中每条到达的推文若通过贯穿整个爬取过程的评分被判定与查询关键词相关,则予以考虑。该评分考虑了推文文本、标签以及发布、回复、被提及或转发该推文的用户。基于此分数,STiC 能在每次迭代中选择相关推文,并通过添加相关有价值推文继续。针对不同类型查询已开展若干实验,结果表明相较于简单 BFS 搜索精度有所提升。

关键词

引用

@article{arxiv.2110.06022,
  title  = {Smart Crawling: A New Approach toward Focus Crawling from Twitter},
  author = {Ahmad Khazaie and Nacéra Bennacer Seghouani and Francesca Bugiotti},
  journal= {arXiv preprint arXiv:2110.06022},
  year   = {2021}
}