基于受错配误差污染的关联数据的指数族回归估计
统计方法学
2020-10-27 v2
摘要
在多个文件中识别匹配记录可能是一项具有挑战性且易出错的任务。关联误差会显著影响基于所得关联文件的后续统计分析。最近的几篇论文从“破损样本问题”和“置换数据”的角度,研究了响应变量在一个文件、协变量在第二个文件中的关联后线性回归分析。在本文中,我们将这一研究方向扩展至指数族响应,并假设错配数量较少到中等。我们提出了一种基于观测特定偏移量以考虑潜在错配和 惩罚的方法,并讨论了其统计性质。在回归参数已知的情况下,我们还给出了协变量与响应之间正确对应关系得以恢复的充分条件。所提出的方法在理论和实证上基于合成数据与真实数据,与已有的基线(即 Lahiri-Larsen 和 Chambers 的方法)进行了比较。结果表明,即使仅可获得关于关联过程的有限信息,也能相较这些方法取得实质性改进。
引用
@article{arxiv.2010.00181,
title = {Estimation in exponential family Regression based on linked data contaminated by mismatch error},
author = {Zhenbang Wang and Emanuel Ben-David and Martin Slawski},
journal= {arXiv preprint arXiv:2010.00181},
year = {2020}
}
备注
51 pages, 7 figures