中文

基于公开推文的机器学习模型预测美国大都市区邮政编码级别的疫苗犹豫

社会与信息网络 2021-08-05 v1 人工智能 计算机与社会 机器学习

摘要

尽管近期美国 COVID-19 疫苗的推广和接种情况令人鼓舞,但在成年人口的各种地理和人口统计集群中仍然存在显著的疫苗犹豫。诸如 Gallup 过去一年进行的调查等调查在确定疫苗犹豫方面可能有用,但实施成本高昂且无法提供实时数据。与此同时,社交媒体的出现表明,通过使用机器学习模型以及来自公开来源的社会经济(及其他)特征,可能有可能在聚合层面(例如邮政编码级别)获取疫苗犹豫信号。目前,这样的尝试是否可行,以及它与仅使用常数先验的基线相比表现如何,仍是一个开放性问题。据我们所知,目前尚未提出使用真实数据的适当方法和评估结果。在本文中,我们使用过去一年收集的公开 Twitter 数据,提出了一种这样的方法和实验研究。我们的目标不是设计新颖的机器学习算法,而是在比较框架中评估现有且成熟的模型。我们表明,最佳模型显著优于常数先验,并且可以使用开源工具进行构建。

关键词

引用

@article{arxiv.2108.01699,
  title  = {Predicting Zip Code-Level Vaccine Hesitancy in US Metropolitan Areas Using Machine Learning Models on Public Tweets},
  author = {Sara Melotte and Mayank Kejriwal},
  journal= {arXiv preprint arXiv:2108.01699},
  year   = {2021}
}

备注

15 pages, 4 tables, currently under review at PLOS Digital Health