如何从五数概括估计样本均值与标准差?
统计方法学
2018-01-08 v1
摘要
在一些临床研究中,研究者可能报告五数概括(包括样本中位数、第一与第三四分位数、最小值和最大值),而非样本均值和标准差。为了对研究进行合并的荟萃分析,需要首先从五数概括估计样本均值和标准差。近期文献中已提出若干研究来解决该问题。然而,现有的用于标准差的估计量均不能令人满意地用于实际。在简要回顾现有文献后,我们指出 Wan 等人方法(BMC Med Res Methodol 14:135, 2014)在从五数概括估计标准差方面存在严重局限。为改进之,我们提出一种通过引入样本量信息的平滑加权估计量,并推导出该新估计量的最优权重。为便于实施,我们还提供了最优权重的近似公式以及从五数概括估计标准差的快捷公式。所提估计量的性能通过两项模拟研究进行了评估。与 Wan 等人的估计量相比,我们的新估计量对正态数据提供了更准确的估计,对非正态数据表现良好。在真实数据分析中,我们的新方法也能比现有方法更准确地估计真实样本标准差。本文中,我们提出了一种从五数概括估计标准差的最优估计量。结合 Luo 等人(Stat Methods Med Res, in press, 2017)中的最优均值估计量,我们的新方法改进了现有文献,并将对荟萃分析和循证医学作出切实贡献。
引用
@article{arxiv.1801.01267,
title = {How to estimate the sample mean and standard deviation from the five number summary?},
author = {Jiandong Shi and Dehui Luo and Hong Weng and Xian-Tao Zeng and Lu Lin and Tiejun Tong},
journal= {arXiv preprint arXiv:1801.01267},
year = {2018}
}
备注
18 pages, 5 figures, 2 tables