两阶段流行病学研究中用于暴露预测的最优设计域适应方法
应用统计
2021-07-19 v1
摘要
在两阶段研究的第一阶段,研究者使用统计模型来插补未观测到的暴露变量。在第二阶段,插补得到的暴露变量作为流行病学模型中的协变量。第一阶段的插补误差在第二阶段表现为测量误差,从而偏倚暴露效应的估计。本研究旨在通过在第一阶段与第二阶段之间共享信息来改进暴露效应的估计。我们估计量的核心在于观察到并非所有第二阶段观测都同等重要、需要插补。因此,我们借鉴最优实验设计理论,识别出重要性更高的个体。随后,利用机器学习文献中域适应(domain-adaptation)的思想,改进这些个体的插补。我们的模拟证实,暴露效应估计比当前最佳实践更为准确。一项实证分析显示,PM对高血糖风险效应的估计更小,且置信带更窄。环境科学家与流行病学家之间的信息共享可改善健康效应估计。我们的估计量是一种利用这一信息交换的原则性方法,可应用于任意两阶段研究。
引用
@article{arxiv.2107.07602,
title = {Optimal-Design Domain-Adaptation for Exposure Prediction in Two-Stage Epidemiological Studies},
author = {Ron Sarafian and Itai Kloog and Jonathan D. Rosenblatt},
journal= {arXiv preprint arXiv:2107.07602},
year = {2021}
}