使用 R-INLA 进行计算:准确性与可重复性及其对 COVID-19 数据分析的启示
应用统计
2021-11-03 v1
摘要
用于分析医学数据的统计方法正变得日益复杂。新颖的统计方法越来越依赖模拟研究来评估其有效性。此类评估通常出现在统计或计算类期刊上,随后该方法通过教程介绍给医学界。如果应用研究者将该方法论用于尚未被评估的场景,这可能会带来问题。在本文中,我们探讨了一个此类方法在 2019 冠状病毒病(COVID-19)数据分析中流行起来的案例研究。R-INLA 包中实现的集成嵌套拉普拉斯近似(INLA)近似了从完全贝叶斯分析本应获得的目标参数的边际后验分布。我们试图回答一个重要问题:现有关于 INLA 近似准确性的研究是否支持研究者当前使用它来分析 COVID-19 数据的方式?我们指出了评估 INLA 准确性的三项局限:1)准确性的定义不一致;2)缺乏验证研究者实际如何使用 INLA 的研究;3)缺乏对 INLA 输出可重复性的研究。我们基于 COVID-19 研究中使用的模型和数据,通过模拟研究探讨了每项局限的实际影响。我们的结果表明,现有的 INLA 技术准确性评估方法可能并不支持 COVID-19 研究者的使用方式。在部分由我们的结果指导下,我们为主要经由模拟研究验证的统计方法论使用者提出了一套建议的最低指南。
引用
@article{arxiv.2111.01285,
title = {Computing with R-INLA: Accuracy and reproducibility with implications for the analysis of COVID-19 data},
author = {Kori Khan and Hengrui Luo and Wenna Xi},
journal= {arXiv preprint arXiv:2111.01285},
year = {2021}
}