中文

利用简单语义过滤增强 Twitter 数据分析:以追踪类流感疾病为例

社会与信息网络 2016-11-17 v1 计算与语言 物理与社会

摘要

利用 Twitter 消息等公开用户生成内容的系统在追踪季节性流感方面已取得成功。我们开发了一种针对类流感疾病 (ILI) 相关消息的新型过滤方法,使用了来自 Twitter 微博的 5.87 亿条消息。我们首先基于 BioCaster 本体(一种现有的外行术语知识模型)中的综合征关键词对消息进行过滤。随后,我们根据否定、话题标签、表情符号、幽默和地理位置等语义特征对消息进行过滤。数据涵盖了 2009 年 8 月 30 日至 2010 年 5 月 8 日美国 2009 年流感季节的 36 周。结果显示,我们的系统达到了 98.46% 的最高 Pearson 相关系数(p 值<2.2e-16),比之前的最先进方法提高了 3.98%。结果表明,对现有挖掘 Twitter 数据的方法进行简单的基于 NLP 的增强,可以提升这一廉价资源的价值。

关键词

引用

@article{arxiv.1210.0848,
  title  = {Enhancing Twitter Data Analysis with Simple Semantic Filtering: Example in Tracking Influenza-Like Illnesses},
  author = {Son Doan and Lucila Ohno-Machado and Nigel Collier},
  journal= {arXiv preprint arXiv:1210.0848},
  year   = {2016}
}

备注

10 pages, 5 figures, IEEE HISB 2012 conference, Sept 27-28, 2012, La Jolla, California, US