中文

COVID-19暴发中活跃病例预测的小样本量诅咒

机器学习 2020-11-30 v2 机器学习

摘要

在COVID-19大流行期间,人们进行了大量关于病例数及该大流行其他未来趋势预测的尝试。然而,它们未能以可靠的方式在可接受精度内预测COVID-19暴发基本特征的的中长期演变。本文对机器学习模型在这一特定预测问题中的失败给出了一种解释。论文表明,简单线性回归模型能可靠地提供高预测精度值,但仅针对2周时段;而相对复杂的机器学习模型虽有潜力以低误差学习长期预测,却无法在具备高泛化能力的同时获得良好预测。论文指出,样本数量不足是预测模型低预测性能的根源。关于活跃病例预测结果的可靠性以交叉验证预测误差来衡量,这些误差被用作预测器泛化误差的期望值。为利用与活跃病例最相关的信息,我们在多种变量上进行了特征选择。我们应用了不同的特征选择方法,即两两相关、递归特征消除,以及使用Lasso回归的特征选择,并将它们相互比较,也与未采用任何特征选择的模型比较。此外,我们比较了线性回归、多层感知机与长短期记忆模型,每种模型均与上述特征选择方法结合用于预测活跃病例。我们的结果表明,由于COVID-19数据的小样本量,具备高泛化能力的活跃病例准确预测仅可至多提前3天。

关键词

引用

@article{arxiv.2011.03628,
  title  = {Curse of Small Sample Size in Forecasting of the Active Cases in COVID-19 Outbreak},
  author = {Mert Nakıp and Onur Çopur and Cüneyt Güzeliş},
  journal= {arXiv preprint arXiv:2011.03628},
  year   = {2020}
}