中文

职业需求调查中的缺失值填补

统计方法学 2022-01-25 v1

摘要

美国劳工统计局允许公众访问其通过职业需求调查(ORS)获取的大量数据。这些数据可用于推断美国劳动力中各种工作及工作类别的需求。然而,该数据集包含大量缺失的观测值和估计值,这在一定程度上限制了其实用性。在此,我们提出一种填补这些缺失值的方法,该方法利用了调查数据中存在的许多固有特征,例如已知的总体限制以及职业与任务之间的相关性。该方法采用迭代回归拟合,通过最新版本的XGBoost实现,并在从已知值及其调查报告中给出的标准差所描述的分布中抽取的一组模拟值上执行,从而为每个缺失估计值得到一个预测值分布。这使我们能够计算平均预测值,并用95%置信区间界定该估计值。我们讨论了该方法的使用,以及由此产生的填补值如何被用来指导和推进基于ORS收集数据的未来研究领域。最后,我们概述了WIGEM,这是我们提出的加权迭代填补算法的通用版本,可应用于其他情境。

关键词

引用

@article{arxiv.2201.09811,
  title  = {Imputing Missing Values in the Occupational Requirements Survey},
  author = {Terry Leitch and Debjani Saha},
  journal= {arXiv preprint arXiv:2201.09811},
  year   = {2022}
}

备注

A (preliminary) software package implementing our method and further downstream analyses is available on Github at https://github.com/saharaja/imputeORS