中文

面向数千万观测值分位数回归的快速推断

计量经济学 2023-11-02 v5 统计计算

摘要

大数据分析为经济研究开辟了新途径,但分析具有数千万观测值的数据集挑战巨大。基于极值估计量的传统计量经济学方法需要大量计算资源和内存,而这些资源往往不易获得。本文关注应用于“超大型”数据集(如美国十年一次的人口普查)的线性分位数回归。我们提出了一个利用随机次梯度下降(S-subGD)更新的快速推断框架。该推断过程按顺序处理横截面数据:(i) 用每个到来的“新观测值”更新参数估计,(ii) 将其聚合为 Polyak-Ruppert\textit{Polyak-Ruppert} 平均,以及 (iii) 仅使用解路径计算用于推断的枢轴统计量。该方法借鉴时间序列回归,通过随机缩放构造渐近枢轴统计量。我们提出的检验统计量以完全在线方式计算,且临界值无需重采样即可算出。我们进行了广泛的数值研究以展示所提推断的计算优势。对于规模高达 (n,d)(107,103)(n, d) \sim (10^7, 10^3) 的推断问题(其中 nn 为样本量,dd 为回归元个数),我们的方法产生了新的见解,在计算上超越了当前推断方法。我们的方法特别利用数百万观测值揭示了美国大学工资溢价中性别差距的趋势,同时控制超过 10310^3 个协变量以减轻混杂效应。

关键词

引用

@article{arxiv.2209.14502,
  title  = {Fast Inference for Quantile Regression with Tens of Millions of Observations},
  author = {Sokbae Lee and Yuan Liao and Myung Hwan Seo and Youngki Shin},
  journal= {arXiv preprint arXiv:2209.14502},
  year   = {2023}
}

备注

62 pages, 8 figures