机器学习用于官方统计数据的生产:基于偏差交易数据的日本劳动统计密度比估计
应用统计
2025-10-29 v1
摘要
国家统计局正在开始使用非传统数据源来生产官方统计数据。这些数据最初是为非统计目的收集的,包括点-of-sale (POS) 数据和移动电话全球定位系统 (GPS) 数据。这些数据有望显著提升官方统计数据的实用性。在大数据时代,许多私营公司正在积累巨大的交易数据。探索如何利用这些数据来生产官方统计数据变得日益重要。然而,进展缓慢,主要是因为这些数据不是通过基于抽样的调查方法收集的,因此存在显著的选择偏差。如果能够正确处理这种偏差,这些数据就可能成为官方统计数据中宝贵的资源,从而大大扩展其范围并提高决策质量,包括经济政策。本文演示了即使是带偏差的交易数据,仍可通过运用机器学习领域中 developed 的密度比估计和协变量迁移下的监督学习概念,为迅速发布的官方统计数据生产提供帮助。作为案例研究,我们展示了可以使用来自日本私营雇佣机构的带偏差数据,及时生产出预统计数据。这种方法使得可以提前发布一个关键劳动力市场指标,该指标原本需要最多一年的延迟,导致无法进行及时决策。
引用
@article{arxiv.2510.24153,
title = {Machine Learning for the Production of Official Statistics: Density Ratio Estimation using Biased Transaction Data for Japanese labor statistics},
author = {Yuya Takada and Kiyoshi Izumi},
journal= {arXiv preprint arXiv:2510.24153},
year = {2025}
}
备注
23 pages, 9 figures. Under review at Journal of Computational Social Science