中文

EpiCastBench:面向多元流行病预测的数据集与基准

机器学习 2026-05-13 v1 人工智能 数据库 定量方法

摘要

数据驱动决策在公共卫生领域的日益普及,使得流行病预测成为一个关键的研究领域。与独立建模单个序列的传统单变量方法相比,多元预测模型的最新进展能更好地捕捉复杂的时间依赖关系。尽管有这种潜力,但鲁棒的流行病预测方法的发展受到缺乏高质量基准的限制,这些基准应包含跨传染病和地理区域的多样化多元数据集。为了弥补这一差距,我们提出了 EpiCastBench,一个大规模基准测试框架,包含 40 个精心整理的(相关的)多元流行病数据集。这些公开可用的数据集涵盖了广泛的传染病,并在时间粒度、序列长度和稀疏性方面表现出多样化的特征。我们分析了这些数据集,以识别其全局特征和结构模式。为了确保可重复性和公平比较,我们建立了标准化的评估设置,包括统一的预测时域、一致的预处理流程、多样化的性能指标和统计显著性检验。通过利用这个框架,我们对 15 个多元预测模型进行了全面评估,这些模型涵盖了从统计基线到最先进的深度学习和基础模型。所有数据集和代码均在 Kaggle (https://www.kaggle.com/datasets/aimltsf/epicastbench) 和 GitHub (https://github.com/aimltsf/EpiCastBench) 上公开可用。

关键词

引用

@article{arxiv.2605.11598,
  title  = {EpiCastBench: Datasets and Benchmarks for Multivariate Epidemic Forecasting},
  author = {Madhurima Panja and Danny D'Agostino and Huitao Li and Tanujit Chakraborty and Nan Liu},
  journal= {arXiv preprint arXiv:2605.11598},
  year   = {2026}
}