通过社交媒体数据挖掘确定健康效用
计算与语言
2016-08-16 v1 人工智能
计算机与社会
社会与信息网络
摘要
“健康效用”(health utilities)衡量患者相对于特定不健康状态(如哮喘、髋部骨折或结肠癌)对完美健康的偏好。随时间积分后,这些估计称为质量调整生命年(quality adjusted life years, QALYs)。迄今为止,表征健康效用(HUs)需要详细的患者访谈或书面调查。尽管可靠且具体,但由于寻找、招募和协调参与者的工作,该数据仍然昂贵。因此,所检查疾病的范围、背景和时间性仍然有限。如今超过十亿人使用社交媒体,我们提出一种新策略:使用自然语言处理分析公共在线对话中以获取疾病严重程度的信号,并利用机器学习将这些信号与已知的HUs相关联。在这项工作中,我们筛选了最初包含20亿条推文的数据集,以获取60种疾病的相关内容。利用该数据,我们的算法成功区分了轻微与严重疾病,而此前仅通过传统技术分类。这代表了两个相关应用的进展:第一,在不存在此类信息处预测HUs;第二,(在已有丰富HU数据处)通过数据挖掘估计疾病严重程度的时间或地理模式。
引用
@article{arxiv.1608.03938,
title = {Determining Health Utilities through Data Mining of Social Media},
author = {Christopher Thompson and Josh Introne and Clint Young},
journal= {arXiv preprint arXiv:1608.03938},
year = {2016}
}
备注
8 pages, 2 figures, 3 tables