聚合异构数据在流行病学建模中的偏差
人工智能
2021-06-22 v1 种群与进化
应用统计
摘要
在流行病学建模中,大多数分析假设单一流行过程生成真实数据。然而,这一假设的数据生成过程可能不切实际,因为流行病数据源通常跨地理区域和社区聚合。因此,用于估计流行病学参数(例如传播率)的最先进模型在面临复杂系统时可能不适用。我们的工作实证展示了将流行病学模型应用于聚合数据集的一些局限。我们通过组合多个独立使用具有不同参数集的 SEIR 模型模拟的流行曲线,生成了三种复杂暴发场景。利用这些场景,我们评估了一种最先进的贝叶斯推断方法的鲁棒性,该方法从病毒载量监测数据估计流行轨迹。我们在该贝叶斯推断框架内评估了两种数据生成模型:简单指数增长模型和高度灵活的高斯过程先验模型。我们的结果表明,两种模型都为组合流行曲线生成了准确的传播率估计,但代价是为每个潜在流行生成了有偏估计,反映出高度异质的潜在人群动态。指数增长模型虽可解释,但无法捕捉潜在流行的复杂性。在充足监测数据下,高斯过程先验模型能捕捉复杂轨迹的形状,但在低数据覆盖期不精确。因此,我们的结果凸显了忽视数据生成过程中的复杂性与异质性可能掩盖潜在的地点和人群特定流行动态的潜在陷阱。
引用
@article{arxiv.2106.10610,
title = {Discrepancies in Epidemiological Modeling of Aggregated Heterogeneous Data},
author = {Anna L. Trella and Peniel N. Argaw and Michelle M. Li and James A. Hay},
journal= {arXiv preprint arXiv:2106.10610},
year = {2021}
}
备注
Accepted to IJCAI 2021 Workshop on Artificial Intelligence for Social Good