中文

爬取 Twitter 政治社群并提取政治倾向

社会与信息网络 2021-02-02 v1

摘要

理论上,研究在线社群的大数据方法的一大优势在于,应当可以从宽泛定义的群体中抽取具有代表性的随机样本。然而在实践中,数据收集过程并未规范化,即便对于 Twitter 和 Facebook 等知名社交媒体平台也是如此。这导致诸如“多少数据才足够?”以及所抽取样本对在线社交网络中被研究更广泛群体的代表性如何等问题存在模糊性。本文提出一种聚焦的来回爬取方法以及经过验证的种子选择方法,用于从 Twitter 收集网络级数据。所提爬取方法无需 Twitter 网络的完整网络图即可提取社群结构,并利用“参考分数(reference score)”验证其规模。它还通过追踪已被纳入数据中的已知节点比例,解决了 Twitter 中的采样规模问题。从而解决了 Twitter 数据收集流程中的大多数主要问题,并朝着将该平台数据收集方法规范化的方向迈进了一步。一旦社群被爬取且网络图干净完整,便可利用社群作为特征训练机器学习分类器,在更大尺度上预测用户政治倾向。作为一个案例,我使用所提方法将法国政治社群从全球 Twitter 社群中分离,并在连续尺度上获知用户的政治倾向。

关键词

引用

@article{arxiv.2102.00849,
  title  = {Crawling political communities in Twitter and extracting political affiliations},
  author = {Muhammad Umer Gurchani},
  journal= {arXiv preprint arXiv:2102.00849},
  year   = {2021}
}

备注

22 Pages