中文

基于机器学习生成合成微数据的方法——面向企业级业务调查

机器学习 2025-12-16 v2 综合经济学 经济学 应用统计 统计方法学

摘要

美国普查局提供的公开微数据样本(PUMS)已有数十年历史。然而,随着计算能力的大幅提升和大数据的更广泛可用性,重新识别匿名数据的可能性大幅增加,可能违反对调查受访者的保密承诺。数据科学工具可用于生成不包含任何现有个体或企业受访者记录的合成数据,同时保留经验数据的关键时刻。开发面向企业调查的公开数据具有与人口统计数据不同的独特挑战,因为缺乏匿名性且某些行业在每个地理区域都容易被识别。本文简要描述了用于构建基于年度企业调查(ABS)的合成PUMS的机器学习模型,并讨论了各种质量指标。虽然ABS PUMS目前正在细化且结果受保密,但我们为2007年企业所有者调查(Survey of Business Owners)开发了两个合成PUMS,类似于ABS企业数据。对Small Business Economics中发表的高影响力分析的计量经济学复制结果表明,合成数据与真实数据具有较好的类比性,激发了讨论ABS的潜在用例。

关键词

引用

@article{arxiv.2512.05948,
  title  = {Developing synthetic microdata through machine learning for firm-level business surveys},
  author = {Jorge Cisneros and Timothy Wojan and Matthew Williams and Jennifer Ozawa and Robert Chew and Kimberly Janda and Timothy Navarro and Michael Floyd and Christine Task and Damon Streat},
  journal= {arXiv preprint arXiv:2512.05948},
  year   = {2025}
}

备注

17 pages, 4 figures, 6 tables