利用简单语义过滤增强 Twitter 数据分析:以追踪类流感疾病为例
社会与信息网络
2016-11-17 v1 计算与语言
物理与社会
摘要
利用 Twitter 消息等公开用户生成内容的系统在追踪季节性流感方面已取得成功。我们开发了一种针对类流感疾病 (ILI) 相关消息的新型过滤方法,使用了来自 Twitter 微博的 5.87 亿条消息。我们首先基于 BioCaster 本体(一种现有的外行术语知识模型)中的综合征关键词对消息进行过滤。随后,我们根据否定、话题标签、表情符号、幽默和地理位置等语义特征对消息进行过滤。数据涵盖了 2009 年 8 月 30 日至 2010 年 5 月 8 日美国 2009 年流感季节的 36 周。结果显示,我们的系统达到了 98.46% 的最高 Pearson 相关系数(p 值<2.2e-16),比之前的最先进方法提高了 3.98%。结果表明,对现有挖掘 Twitter 数据的方法进行简单的基于 NLP 的增强,可以提升这一廉价资源的价值。
引用
@article{arxiv.1210.0848,
title = {Enhancing Twitter Data Analysis with Simple Semantic Filtering: Example in Tracking Influenza-Like Illnesses},
author = {Son Doan and Lucila Ohno-Machado and Nigel Collier},
journal= {arXiv preprint arXiv:1210.0848},
year = {2016}
}
备注
10 pages, 5 figures, IEEE HISB 2012 conference, Sept 27-28, 2012, La Jolla, California, US