中文

面向海量数据的高计算效率单变量滤波

统计方法学 2020-02-13 v1 统计计算

摘要

大规模、海量与大数据的广泛可得性增加了数据分析的计算成本。其中一个例子是单变量滤波的计算成本,它通常涉及拟合许多单变量回归模型,并且对于众多用于减少预测变量个数的变量选择算法而言必不可少。本文展示了如何通过采用得分检验或简单的 Pearson 相关(或针对二分类响应的 t 检验)来大幅降低该计算成本。广泛的蒙特卡洛模拟研究将展示它们相较于似然比检验的优缺点,并且真实数据示例将说明得分检验与对数似然比检验在现实场景下的表现。根据所用回归模型的不同,得分检验比对数似然比检验快 30 至 60000 倍,并产生近乎相同的结果。因此,本文强烈建议在处理大规模数据、海量数据、大数据,甚至样本量达数万或更高的数据时,以得分检验替代对数似然比检验。

关键词

引用

@article{arxiv.2002.04691,
  title  = {Computationally efficient univariate filtering for massive data},
  author = {M. Tsagris and A. Alenazi and S. Fafalios},
  journal= {arXiv preprint arXiv:2002.04691},
  year   = {2020}
}

备注

The paper has been submitted