中文

社交媒体数据整理

社会与信息网络 2020-02-24 v1 计算机视觉与模式识别

摘要

社交媒体平台推动了现代时代民众脉搏的民主化。由于其极高的普及率和使用量,发布在社交媒体网站(如 Twitter、Facebook 和 Tumblr)上的数据是一片丰富的信息海洋。因此,对社交印记进行数据驱动的分析已成为组织和政府进一步改进其产品与服务的重要资产。然而,由于社交媒体数据具有动态和噪声的特性,对原始数据执行精确分析是一项具有挑战性的任务。一个关键需求是在将原始数据输入分析流水线之前对其进行整理。这一整理过程将原始数据转化为情境化数据与知识。我们提出了一个名为 CrowdCorrect 的数据整理流水线,使分析人员能够清理和整理社交数据,并为其可靠的进行分析做好准备。我们的流水线利用现有的内部工具从社交媒体数据语料库中自动提取特征。此外,我们提供了一种结合自动化与众包方法的双重校正机制。该流水线的实现还包括一组用于自动创建微任务的工具,以促进众包用户参与原始数据的整理。出于本研究目的,我们使用 Twitter 作为我们的示例社交媒体数据平台,因其广受欢迎。

关键词

引用

@article{arxiv.2002.09202,
  title  = {Curating Social Media Data},
  author = {Kushal Vaghani},
  journal= {arXiv preprint arXiv:2002.09202},
  year   = {2020}
}

备注

Masters by Research Thesis