含污染数据的密度估计:极小极大速率与自适应理论
统计理论
2018-07-30 v3 统计方法学
统计理论
摘要
本文研究污染模型设定下逐点损失下的密度估计。目标是在某 处用i.i.d.观测 估计 ,其中 表示污染分布。在多重检验语境中,这可解释为估计某点的零密度。我们通过以下模型指标仔细研究污染对估计的影响:污染比例 、目标密度光滑度 、污染密度光滑度 ,以及待估计点的污染水平 ,即 。结果表明,关于平方误差损失的极小极大速率为 其刻画了污染对该问题难度的确切影响。我们随后建立对污染比例、光滑度及两者同时自适应的极小代价。表明三种情形中任一自适应都需支付些许代价。考虑Lepski方法的变体以实现最优自适应。当对污染分布无光滑度假设时亦研究该问题。此允许任意污染分布的设定被认定为Huber的 -污染模型。极小极大速率显示为 自适应理论亦不同于光滑污染情形。对污染比例或光滑度任一的自适应仅耗费对数因子,而对两者同时自适应被证明不可能。
引用
@article{arxiv.1712.07801,
title = {Density Estimation with Contaminated Data: Minimax Rates and Theory of Adaptation},
author = {Haoyang Liu and Chao Gao},
journal= {arXiv preprint arXiv:1712.07801},
year = {2018}
}