中文

基于$L^2$损失的密度估计中的最优交叉验证

统计理论 2014-10-02 v4 统计理论

摘要

我们分析了交叉验证在密度估计框架中的性能,有两个目的:(i) 风险估计和(ii) 模型选择。主要关注所谓的留pp出交叉验证程序,其中pp表示测试集的基数。为投影估计量的风险的Lpo估计量建立了闭式表达式。这些表达式在变异性和计算复杂度方面比VV折交叉验证有了很大改进。从理论角度来看,闭式表达式还使得能够研究Lpo在风险估计方面的性能。在用于风险估计的交叉验证程序中,证明了留一法(即p=1p=1的Lpo)的最优性。还考虑了两种模型选择框架:估计与识别。对于有限样本量nn的估计,当pp足够大[且p/n=o(1)p/n=o(1)]以平衡由模型集合结构导致的过拟合时,可实现最优性。对于识别,只要p/np/n与集合中最佳估计量的收敛速率适当相关,就建立了Lpo的模型选择相合性:(i) 当n+n\to+\infty时,p/n1p/n\to1,具有参数速率;(ii) 对于某些非参数估计量,p/n=o(1)p/n=o(1)。这些理论结果通过模拟实验得到了验证。

关键词

引用

@article{arxiv.0811.0802,
  title  = {Optimal cross-validation in density estimation with the $L^2$-loss},
  author = {Alain Celisse},
  journal= {arXiv preprint arXiv:0811.0802},
  year   = {2014}
}

备注

Published in at http://dx.doi.org/10.1214/14-AOS1240 the Annals of Statistics (http://www.imstat.org/aos/) by the Institute of Mathematical Statistics (http://www.imstat.org)