从推文句子嵌入追踪州级肥胖患病率:一项可行性研究
计算与语言
2019-12-04 v2 社会与信息网络
摘要
Twitter 数据已被广泛证明适用于公共卫生监测。以往基于 Twitter 数据的公共卫生研究主要依赖关键词匹配或主题模型来聚类相关推文。然而,这两种方法都受限于文本长度短以及在用户生成语境中自然出现的不可预测的噪声。为此,我们引入一种深度学习方法,利用话题标签作为一种监督形式,并学习推文嵌入以提取信息性文本特征。在本案例研究中,我们针对从饮食相关文本特征估算州级肥胖率这一具体任务。我们的方法得到的估算结果使文本特征与政府数据强相关,并优于关键词匹配基线。结果还展示了利用文本特征发现风险因素的潜力。该方法是通用目的的,可应用于广泛的基于 Twitter 的公共卫生研究。
引用
@article{arxiv.1911.11324,
title = {Tracing State-Level Obesity Prevalence from Sentence Embeddings of Tweets: A Feasibility Study},
author = {Xiaoyi Zhang and Rodoniki Athanasiadou and Narges Razavian},
journal= {arXiv preprint arXiv:1911.11324},
year = {2019}
}