利用社交媒体帖子的无监督嵌入聚类预测COVID-19病例数
计算与语言
2022-05-25 v1 社会与信息网络
摘要
我们提出一种将基于Transformer的语言模型纳入传染病建模的新方法。通过追踪特定美国各州COVID-19子版Reddit帖子的句子级表示的高密度聚类,对文本衍生特征进行量化。我们将这些聚类嵌入特征与其他高质量数据集提取的特征进行基准比较。在一个阈值分类任务中,我们表明它们在预测上升趋势信号上优于所有其他特征类型,这对于流行病学数据不可靠地区的传染病建模是一项重要结果。随后,在一个时间序列预测任务中,我们充分利用病例数的预测能力,并在基于Transformer的时间序列模型中比较使用不同补充数据集作为协变量特征集的相对优势。
引用
@article{arxiv.2205.10408,
title = {Forecasting COVID-19 Caseloads Using Unsupervised Embedding Clusters of Social Media Posts},
author = {Felix Drinkall and Stefan Zohren and Janet B. Pierrehumbert},
journal= {arXiv preprint arXiv:2205.10408},
year = {2022}
}
备注
NAACL 2022