使用不同供体-受者距离度量融合收入与消费信息的数据融合
统计方法学
2020-12-02 v1
摘要
数据融合描述了将(至少)两个初始独立的数据源组合以允许对未联合观测的变量进行联合分析的方法。其基本思想是基于识别假设,以及提供所有数据源中联合观测信息公共变量进行推断。处理这一特定缺失数据问题的一类流行方法基于最近邻匹配。然而,随着公共信息增加,精确匹配变得不太可能,且距离函数的设定会影响数据融合的结果。在本文中,我们比较了两种不同的最近邻热卡匹配方法:其一,随机热卡(Random Hot Deck),是由 Eurostat 提出的基于协变量的匹配方法的变体,可视为“经典”统计匹配方法;另一种替代方法则基于预测均值匹配(Predictive Mean Matching)。我们讨论了一项模拟研究的结果,以考察两种变体的优势与潜在缺陷,我们的发现表明预测均值匹配往往优于随机热卡。
引用
@article{arxiv.2012.00081,
title = {Data Fusion for Joining Income and Consumption Information Using Different Donor-Recipient Distance Metrics},
author = {Florian Meinfelder and Jannik Schaller},
journal= {arXiv preprint arXiv:2012.00081},
year = {2020}
}