中文

模型化欠报告数据:朴素方法的陷阱与新统计框架用于流行病曲线重建

应用统计 2025-09-16 v1

摘要

计数值为自回归模型广泛用于分析报告感染性病例的时间序列,因为其与离散时间传播模型的紧密联系。然而,当此类模型直接应用于欠报告的病例计数时,其机理解释可能就会失效。我们建立了新的理论结果,量化了在这些模型中忽略欠报告的后果。为了解决这个问题,报告的病例常常被建模为底层计数过程的二项分布稀疏版本,但此类模型 difficult to fit 因为未观测到的真实计数是串联相关且整数值。我们发展了一种新的统计框架,用于欠报告的传染病数据,该框架使用对广泛的稀疏计数自回归模型的正态-正态近似,然后准确地将这一连续过程映射回整数。通过仿真和应用于德国一个州的腺病毒发病率以及英国都市区的新冠病毒发病率,我们展示了我们的做法既保留了稀疏自回归模型的机械学吸引力,又大大简化了推断。

关键词

引用

@article{arxiv.2509.10668,
  title  = {Modelling Under-Reported Data: Pitfalls of Na\"ive Approaches and a New Statistical Framework for Epidemic Curve Reconstruction},
  author = {Justin J. Slater and Sindi Bebeziqi},
  journal= {arXiv preprint arXiv:2509.10668},
  year   = {2025}
}