中文

建模 Twitter 上与情感相关的时空因素:综合及对改进局部偏差识别的建议

社会与信息网络 2019-05-16 v2 计算与语言

摘要

背景:考察社交媒体上情感如何随时间和地点变化的研究似乎产生了不一致的结果,使得设计利用情感检测局部事件以用于公共卫生应用的系统变得困难。目的:本研究的目的是衡量常见的时间与地点混杂因素如何解释 Twitter 上情感的变异。方法:使用 2017 年 7 月 13 日至 11 月 30 日间来自 100 个城市的 1654 万条英语推文的数据集,我们基于词典的情感分析估计了各城市的正向与负向情感,并构建模型以时间(一天中的时段)、星期几、天气、城市以及互动类型(对话或广播)作为因素来解释情感差异,发现所有因素均与情感独立相关。结果:在正向(测试数据 Pearson r 0.236;95% CI 0.231-0.241)与负向(测试数据 Pearson r 0.306;95% CI 0.301-0.310)情感的完整多变量模型中,城市与一天中的时段比天气和星期几解释了更多方差。考虑这些混杂因素的模型相较于未考虑的模型,产生了不同的重要事件分布与排序。结论:在旨在通过聚合 Twitter 用户群体情感来检测局部事件的公共卫生应用中,在寻找意外变化之前考虑基线差异是值得的。

关键词

引用

@article{arxiv.1802.07859,
  title  = {Modeling Spatiotemporal Factors Associated With Sentiment on Twitter: Synthesis and Suggestions for Improving the Identification of Localized Deviations},
  author = {Zubair Shah and Paige Martin and Enrico Coiera and Kenneth D. Mandl and Adam G. Dunn},
  journal= {arXiv preprint arXiv:1802.07859},
  year   = {2019}
}

备注

18 pages, 7 figures, published in JMIR (doi:10.2196/12881)