中文

衡量与评估移动电话人口数据的系统机器学习方法

应用统计 2025-09-04 v1 计算机与社会

摘要

传统的人口数据来源,如普查和调查,成本高昂、频率不高,且常在危机地区不可得。移动电话应用数据提供了近实时、高分辨率的人口分布洞察,但其效用受到数字技术获取和使用的不平等导致的偏差问题,这些偏差威胁着数据的代表性。尽管对这些问题的认识日益增长,但仍不存在标准框架来衡量和解释此类偏差,限制了数字痕迹在研究和政策中的可靠性。我们发展并实现了一个系统且可复制的框架,用于在不要求个人人口属性的情况下,对聚合后的移动电话应用数据量化覆盖偏差。该方法将透明的人口覆盖指标与可解释机器学习相结合,用于识别空间偏差的背景驱动因素。使用针对2021年人口普查基准的四个数据集,我们展示了移动电话数据在人口覆盖方面通常优于主要国家调查,但仍存在跨数据源和亚国家区域的显著偏差。覆盖偏差与人口特征、社会经济特征和地理特征密切相关,往往以复杂的非线性方式关联。与常见假设相反,多应用数据集不一定比单一应用数据源减少偏差。我们的发现为移动电话数据的偏差评估标准奠定了基础,为研究人员、统计机构和政策制定者提供实用工具,以负责任和公平的方式发掘这些数据集的价值。

关键词

引用

@article{arxiv.2509.02603,
  title  = {A systematic machine learning approach to measure and assess biases in mobile phone population data},
  author = {Carmen Cabrera and Francisco Rowe},
  journal= {arXiv preprint arXiv:2509.02603},
  year   = {2025}
}

备注

18 pages; 5 figures; 2 tables