中文

来自不可辨识模型的外部数据中二元化结果的效率借用:保证效率提升

统计方法学 2026-03-30 v2

摘要

在大数据时代,日益多样化的数据源的可用性推动了对整合不同数据源以提高统计准确性、效率和科学见解的方法兴趣。许多现有方法假设数据源在交换性方面,并常常隐式要求数据源测量相同的协变量或结果,或误差分布正确指定——这些假设在复杂现实场景下可能不成立。本文探讨了来自不同结果尺度的数据源的整合,聚焦于利用外部数据来提高统计效率。具体而言,我们考虑主要数据集包括连续结果,而外部数据提供该结果的二元化版本的场景。我们提出了两种新建构器:第一个建构器即使在误差分布可能被指定错误的情况下仍保持渐进一致性,而第二个建构器保证在仅使用主要研究数据alone 的加权最小二乘估计之上实现效率提升。对这些建构器的理论性质进行严格推导,并进行大量模拟研究以突出其在各种情景下的鲁棒性和效率提升。最后,一个来自 NHANES 数据集的实际应用示例展示了所提方法的实用实用性。

关键词

引用

@article{arxiv.2501.06360,
  title  = {Borrowing Information from an Unidentifiable Model: Guaranteed Efficiency Gain with a Dichotomized Outcome in the External Data},
  author = {Lu Wang and Yanyuan Ma and Jiwei Zhao},
  journal= {arXiv preprint arXiv:2501.06360},
  year   = {2026}
}