中文

公共卫生研究中社交媒体数据的人口统计特征:是否重要?

计算机与社会 2017-11-07 v2

摘要

社交媒体数据为公共卫生研究提供了良机。然而,研究表明某些人群(如较低社会经济地位者)在代表性上可能存在差异。为量化并解决人口代表中的这些差异,我们需要人口统计信息,而多数社交媒体平台通常缺失该信息。本文提出一种从社交媒体数据推断人口统计特征的集成方法。已有若干方法用于推断年龄、性别与种族/民族等人口属性,但大多需要大量数据,难以应用于大规模研究。我们开发了一种仅依赖用户名预测性别的可扩展方法。我们基于含7,953名来自Kaggle.com的Twitter用户性别标签的数据训练了三个独立分类器,随后使用堆叠泛化技术整合各分类器预测,并将该集成分类器应用于36,085条来自美国的带地理标签的食源性疾病相关推文数据集。我们的集成方法准确率、精确率、召回率与F1分数分别为0.828、0.851、0.852与0.837,高于各独立机器学习方法。该集成分类器还覆盖任何含字母数字名称的用户,而数据匹配方法虽准确率达0.917,仅覆盖67%用户。将我们的方法应用于美国食源性疾病报告,凸显了按性别发推的差异,并表明食源性疾病相关推文量高的县中女性Twitter用户占比严重偏高。

关键词

引用

@article{arxiv.1710.11048,
  title  = {Demographics in Social Media Data for Public Health Research: Does it matter?},
  author = {Nina Cesare and Christan Grant and Jared B. Hawkins and John S. Brownstein and Elaine O. Nsoesie},
  journal= {arXiv preprint arXiv:1710.11048},
  year   = {2017}
}

备注

Presented at the Data For Good Exchange 2017