中文

广义线性模型在大数据中的应用:分割与重组 (D&R) 方法

统计方法学 2024-12-12 v2

摘要

D&R 是一种用于处理大型复杂数据集的统计方法。它将数据集划分为若干可管理的子集,然后独立地对每个子集应用分析方法以获得结果。最后,将各子集的结果合并以得出整个数据集的结果。D&R 策略可用于为传统方法难以处理的数据集拟合广义线性模型 (GLMs)。针对不同 GLMs 有多种 D&R 策略,其中一些具有理论依据但缺乏实践验证。一个重要限制在于对组合标准误和置信区间进行理论与实践验证。本文综述了 GLMs 的 D&R 策略,并提出了一种确定基于 D&R 的估计量组合标准误的方法。除了传统的数据集划分程序外,我们为 GLMs 上基于 D&R 的估计量提出了一种不同的划分方法——顺序分割。我们证明,采用所提标准误获得的 D&R 估计量达到了与全数据估计量等同的效率。我们在一个大型合成数据集上进行了说明,并验证了 D&R 的结果与其他可用 R 包的结果准确且一致。

关键词

引用

@article{arxiv.2412.05018,
  title  = {Application of generalized linear models in big data: a divide and recombine (D&R) approach},
  author = {Md. Mahadi Hassan Nayem and Soma Chowdhury Biswas},
  journal= {arXiv preprint arXiv:2412.05018},
  year   = {2024}
}