中文

面向高分辨率估计的数据融合

统计方法学 2025-08-21 v1 机器学习

摘要

人口健康指标的高分辨率估计对精准公共卫生至关重要。我们提出了一种高分辨率估计方法,该方法融合了两种不同的数据源:无偏的低分辨率数据源(如汇总的行政数据)和可能有偏的高分辨率数据源(如个体层面的在线调查回复)。我们假设可能有偏的高分辨率数据源是在抽样偏差模型下从总体中生成的,其中可观测变量可以对回复概率产生任意影响,但具有相同可观测变量的单元之间回复对数概率的差异是其可观测变量与结果的充分统计量之间差异的线性函数。我们的数据融合方法学习一个分布,该分布在 KL 散度意义上最接近在线调查分布,且与汇总行政数据及我们的抽样偏差模型保持一致。在一个测试平台上,该方法优于仅依赖单一数据源的基线方法,该测试平台包含由(在线)家庭脉搏调查和真实数据源在相同时间段内以两种地理分辨率测量的三个指标重复测量数据。

关键词

引用

@article{arxiv.2508.14858,
  title  = {Data Fusion for High-Resolution Estimation},
  author = {Amy Guan and Marissa Reitsma and Roshni Sahoo and Joshua Salomon and Stefan Wager},
  journal= {arXiv preprint arXiv:2508.14858},
  year   = {2025}
}