中文

分布式框架下单样本均值向量的假设检验

统计方法学 2021-10-07 v1

摘要

分布式框架被广泛用于处理海量数据,其中样本量 nn 非常大,且数据通常存储在 kk 台不同的机器上。对于期望为 μ\mu 的随机向量 XRpX\in \mathbb{R}^p,检验均值向量 H0:μ=μ0H_0: \mu=\mu_0H1:μμ0H_1: \mu\ne \mu_0(给定向量 μ0\mu_0)是统计学中的基本问题。集中式检验统计量需要高昂的通信代价,当 ppkk 较大时这可能成为负担。为降低通信代价,本文基于 divide and conquer 技术(一种用于分布式统计推断的常用方法)针对该问题提出了分布式检验统计量。具体而言,我们将两种常用的集中式检验统计量分别推广到适用于低维和高维情形的分布式统计量。比较集中式与分布式检验统计量的功效,观察到通信代价与检验功效之间存在基本的权衡。这与 divide and conquer 技术在估计等许多其他问题中的应用截然不同,后者中相关的分布式统计量可媲美集中式统计量。数值结果证实了理论发现。

关键词

引用

@article{arxiv.2110.02588,
  title  = {Hypothesis Testing of One-Sample Mean Vector in Distributed Frameworks},
  author = {Bin Du and Junlong Zhao},
  journal= {arXiv preprint arXiv:2110.02588},
  year   = {2021}
}