基于伯恩斯坦多项式的缺失数据下累积分布函数估计方法
统计理论
2026-03-30 v2 统计方法学
统计理论
摘要
我们研究非参数估计缺失数据随机 (missing at random) 情况下的单变量累积分布函数 (CDF)。 proposed 的估计器通过对逆概率加权 (IPW) 经验 CDF 进行伯恩斯坦算子平滑处理,得到在 [0,1] 区间内的单调曲线,自动适应有界支撑域。我们分析了两种版本:一种是使用已知倾向概率的伪估计器,另一种是使用从离散辅助变量中非参数估计得到的倾向概率的可行估计器,后者在实际中更为常见。对于这两种方法,我们推导了点偏差和方差展开式,建立了关于均方误差的最优多项式次数 m,证明了渐近正态性。一个关键发现是,可行估计器的方差小于伪估计器,具体体现为显著的非负校正项。我们还开发了通过最小二乘交叉验证选择次数的高效方法。蒙特卡洌实验表明,在小到中等样本量下,平滑后的伪和可行估计器在某些模型下优于未平滑的估计器以及 Dubnicka (2009) 提出的 IPW 核密度估计器的积分版本。2017-2018 年 NHANES 调查中脂肪酶谷浆糖的数据应用示例展示了该方法在实际中的有效性。所有用于复现我们分析的代码均可在 GitHub 上轻易获取。
引用
@article{arxiv.2510.07235,
title = {A Bernstein polynomial approach for the estimation of cumulative distribution functions in the presence of missing data},
author = {Rihab Gharbi and Wissem Jedidi and Salah Khardani and Frédéric Ouimet},
journal= {arXiv preprint arXiv:2510.07235},
year = {2026}
}
备注
33 pages, 2 figures, 10 tables