面向不同数据复杂度的灵活记录链接模型
统计方法学
2025-09-16 v3 应用统计
摘要
从 various sources 组合数据能够赋予研究者探索创新问题的能力,例如通过开展健康监测研究所提出的问题。然而,缺乏唯一标识符常常会造成挑战。记录链接程序通过部分标识变量(例如出生年份、邮政编码)来判断不同时间收集的两个观测值是否属于同一个个体。现有方法通常在计算效率与准确性之间进行权衡。传统方法通过简化信息来完成此任务,却忽略了链接决策之间的依赖关系,以及维持一致链接所必需的单向映射关系。现代方法提供了数据生成过程的全面表征,却付出计算开销和灵活性降低的代价。我们提出一种灵活方法,能够适应不同的数据复杂度,处理注册错误,并容纳随时间变化的标识信息。我们的 approach 在准确性和可扩展性之间取得平衡,使用基于潜在变量模型的随机期望最大化算法进行链接估计。我们展示了该方法在大规模真实数据应用中的能力,并通过模拟研究表明该模型对链接变量质量具有鲁棒性。 proposed algorithm FlexRL 已实现并提供于开源 R 包中。
引用
@article{arxiv.2407.06835,
title = {A Flexible Model for Record Linkage},
author = {Kayané Robach and Stéphanie L van der Pas and Mark A van de Wiel and Michel H Hof},
journal= {arXiv preprint arXiv:2407.06835},
year = {2025}
}
备注
Published in JRSSSC in February 2025