中文

含污染数据的密度估计:极小极大速率与自适应理论

统计理论 2018-07-30 v3 统计方法学 统计理论

摘要

本文研究污染模型设定下逐点损失下的密度估计。目标是在某 x0Rx_0\in\mathbb{R} 处用i.i.d.观测 X1,,Xn(1ϵ)f+ϵgX_1,\dots,X_n\sim (1-\epsilon)f+\epsilon g 估计 f(x0)f(x_0),其中 gg 表示污染分布。在多重检验语境中,这可解释为估计某点的零密度。我们通过以下模型指标仔细研究污染对估计的影响:污染比例 ϵ\epsilon、目标密度光滑度 β0\beta_0、污染密度光滑度 β1\beta_1,以及待估计点的污染水平 mm,即 g(x0)mg(x_0)\leq m。结果表明,关于平方误差损失的极小极大速率为 [n2β02β0+1][ϵ2(1m)2][n2β12β1+1ϵ22β1+1], [n^{-\frac{2\beta_0}{2\beta_0+1}}]\vee[\epsilon^2(1\wedge m)^2]\vee[n^{-\frac{2\beta_1}{2\beta_1+1}}\epsilon^{\frac{2}{2\beta_1+1}}], 其刻画了污染对该问题难度的确切影响。我们随后建立对污染比例、光滑度及两者同时自适应的极小代价。表明三种情形中任一自适应都需支付些许代价。考虑Lepski方法的变体以实现最优自适应。当对污染分布无光滑度假设时亦研究该问题。此允许任意污染分布的设定被认定为Huber的 ϵ\epsilon-污染模型。极小极大速率显示为 [n2β02β0+1][ϵ2β0β0+1]. [n^{-\frac{2\beta_0}{2\beta_0+1}}]\vee [\epsilon^{\frac{2\beta_0}{\beta_0+1}}]. 自适应理论亦不同于光滑污染情形。对污染比例或光滑度任一的自适应仅耗费对数因子,而对两者同时自适应被证明不可能。

关键词

引用

@article{arxiv.1712.07801,
  title  = {Density Estimation with Contaminated Data: Minimax Rates and Theory of Adaptation},
  author = {Haoyang Liu and Chao Gao},
  journal= {arXiv preprint arXiv:1712.07801},
  year   = {2018}
}