广义线性模型在大数据中的应用:分割与重组 (D&R) 方法
统计方法学
2024-12-12 v2
摘要
D&R 是一种用于处理大型复杂数据集的统计方法。它将数据集划分为若干可管理的子集,然后独立地对每个子集应用分析方法以获得结果。最后,将各子集的结果合并以得出整个数据集的结果。D&R 策略可用于为传统方法难以处理的数据集拟合广义线性模型 (GLMs)。针对不同 GLMs 有多种 D&R 策略,其中一些具有理论依据但缺乏实践验证。一个重要限制在于对组合标准误和置信区间进行理论与实践验证。本文综述了 GLMs 的 D&R 策略,并提出了一种确定基于 D&R 的估计量组合标准误的方法。除了传统的数据集划分程序外,我们为 GLMs 上基于 D&R 的估计量提出了一种不同的划分方法——顺序分割。我们证明,采用所提标准误获得的 D&R 估计量达到了与全数据估计量等同的效率。我们在一个大型合成数据集上进行了说明,并验证了 D&R 的结果与其他可用 R 包的结果准确且一致。
引用
@article{arxiv.2412.05018,
title = {Application of generalized linear models in big data: a divide and recombine (D&R) approach},
author = {Md. Mahadi Hassan Nayem and Soma Chowdhury Biswas},
journal= {arXiv preprint arXiv:2412.05018},
year = {2024}
}