在插补模型中包含结果变量‘Y’的缘由
统计方法学
2024-03-04 v2 应用统计
摘要
缺失数据是分析流行病学数据时的常见挑战,插补常被用于解决该问题。在此,我们研究分析中所用协变量存在缺失并将被插补的情形。有建议指出,在针对缺失协变量的插补模型中应包含分析模型中的结果变量,但这一建议是否总是成立、以及为何有时成立,并不一定清楚。我们考察了确定性插补(即使用固定值的单一插补)与随机插补(即使用随机值的单一或多重插补)方法,及其对估计插补协变量与结果之间关系的影响。我们从数学上证明,在使用随机插补方法时,将结果变量纳入插补模型不仅是一项建议,更是获得无偏结果的必要条件。此外,我们澄清了关于确定性插补模型的常见误解,并说明为何不应在这些模型中包含结果变量。本文旨在弥合理论与实践中插补的差距,通过数学推导解释常见的统计学建议。我们增进了对插补缺失协变量所涉考量因素的理解,并强调何时必须在插补模型中包含结果变量。
引用
@article{arxiv.2310.17434,
title = {The `Why' behind including `Y' in your imputation model},
author = {Lucy D'Agostino McGowan and Sarah C. Lotspeich and Staci A. Hepler},
journal= {arXiv preprint arXiv:2310.17434},
year = {2024}
}