中文

“社会感知”中我们应当感知谁——分析哪些用户最适于社交媒体的现况预测

社会与信息网络 2015-11-16 v1 计算机与社会

摘要

鉴于公开可用的社交媒体数据量不断增长,利用在线数据研究和量化离线“真实”世界现象的兴趣日益增加。由于社交媒体数据可以近实时且低成本获取,它常被用于“现况预测(now-casting)”诸如流感活动水平或失业率等指数。术语“社会感知(social sensing)”常在此语境下用来描述用户充当“传感器”、公开报告其健康状况或失业情况的想法。一段时间内的传感器活动随后通常以“一推一票”的方式通过简单计数聚合。同时,研究者坦然承认社交媒体用户并非实际人口的完美代表。此外,用户所透露个人生活细节的量存在差异。直观上,应通过给不同用户群分配不同权重来改进现况预测。在本文中,我们问“社会感知实际如何运作?”或者更精确地,“为获得最优结果,我们应当感知谁——又不感知谁?”。我们研究了不同采样策略如何影响两种常见离线指数——流感活动水平与失业率——的现况预测性能。我们展示现况预测可通过1)应用用户过滤技术以及2)选择具有完整资料的用户得以改进。我们还发现,使用正确类型的用户群,即便大幅缩减数据集规模,现况预测性能也不会退化。更根本地,我们通过探究“喋喋不休者是否更好”来描述哪类用户对准确性贡献最大。我们在文末提供了关于如何选取更优用户群以实现更准现况预测的指导。

关键词

引用

@article{arxiv.1511.04134,
  title  = {Whom Should We Sense in "Social Sensing" -- Analyzing Which Users Work Best for Social Media Now-Casting},
  author = {Jisun An and Ingmar Weber},
  journal= {arXiv preprint arXiv:1511.04134},
  year   = {2015}
}

备注

This is a pre-print of a forthcoming EPJ Data Science paper