利用社交媒体识别可预防慢性病风险个体
计算与语言
2016-03-15 v1 计算机与社会
社会与信息网络
摘要
我们描述了一种获取训练数据的策略,该策略用于构建社交媒体驱动的早期检测系统,以识别有患(可预防)2型糖尿病(T2DM)风险的个体。该策略使用一种类似游戏的测验,其数据和问题从Twitter半自动获取。这些问题旨在激发参与者参与度,并收集相关数据以训练应用于个体的公共卫生模型。先前设计的利用Twitter等社交媒体预测肥胖(T2DM的风险因素)的系统,基于政府机构收集的统计数据,在州、县或城市等整个社区上运行。由于这些群体内部个体之间存在显著差异,个体层面的训练数据将更为有效,但此类数据难以获取。本文提出的方法旨在解决这一问题。我们的策略分为两步。首先,我们在(公开)Twitter状态和国家级统计数据上训练了一个随机森林分类器,达到了最先进的(state-of-the-art)准确率。然后,我们将该分类器转换为20个问题风格的测验并发布到线上。在此过程中,我们实现了参与测验个体的高度参与,同时也构建了一个由自愿提供的个体层面数据组成的训练集,用于未来的分类。
引用
@article{arxiv.1603.03784,
title = {Towards using social media to identify individuals at risk for preventable chronic illness},
author = {Dane Bell and Daniel Fried and Luwen Huangfu and Mihai Surdeanu and Stephen Kobourov},
journal= {arXiv preprint arXiv:1603.03784},
year = {2016}
}
备注
This paper will appear in LREC 2016