中文

地理标记推文中的数据噪声、用户偏差与系统错误识别

社会与信息网络 2017-12-08 v1

摘要

许多社交媒体研究人员与数据科学家收集地理标记推文,以对特定主题或事件的过滤消息进行空间分析或识别时空模式。本文系统性地展示了通过 Twitter Streaming API 获取的地理标记推文的特征(数据噪声、用户偏差与系统错误)。首先,我们发现少量(1%)活跃 Twitter 用户可产生大量(16%)的地理标记推文。其次,有显著比例(57.3%)的地理标记推文位于圣迭戈 Twitter Streaming API 边界框之外。第三,我们可通过检查“source”元数据字段检测垃圾、机器人、半机器人推文(数据噪声)。在我们的案例研究中,地理标记推文中数据噪声的比例显著(加州圣迭戈为 29.42%,俄亥俄州哥伦布为 53.47%)。最后,大多数地理标记推文并非由 Android 或 iPhone 设备上的通用 Twitter 应用创建,而是由其他平台如 Instagram 与 Foursquare 创建。我们推荐一个多步骤流程,以利用地理标记推文的未来研究项目中去除这些噪声。

关键词

引用

@article{arxiv.1712.02433,
  title  = {Identifying Data Noises, User Biases, and System Errors in Geo-tagged Twitter Messages (Tweets)},
  author = {Ming-Hsiang Tsou and Hao Zhang and Chin-Te Jung},
  journal= {arXiv preprint arXiv:1712.02433},
  year   = {2017}
}