中文

经验风险最小化器的交叉验证估计量的集中不等式

机器学习 2010-11-02 v1

摘要

在本文中,我们推导了经验风险最小化器泛化误差的交叉验证估计的集中不等式。在一般设定下,我们证明了类似于\cite{KR99}所述的合理性检验界,即“表明该估计的最坏情况误差并不比训练误差估计差太多”的界。我们考虑了具有有限VC维的一般损失函数和预测器类别。我们紧密遵循\cite{DUD03}引入的形式化方法,以涵盖多种交叉验证过程,包括留一法交叉验证、kk折交叉验证、留出法交叉验证(或分割样本)以及留υ\upsilon法交叉验证。特别地,我们重点证明了各种交叉验证过程的一致性。我们指出了每种交叉验证过程在收敛速度方面的优势。一条具有依赖于交叉验证过程(而不仅仅是测试样本中观测值百分比)的过渡阶段的估计曲线,为如何选择交叉验证提供了简单规则。一个有趣的结论是,对于交叉验证过程的一致性,测试样本的大小并不需要趋于无穷大。

关键词

引用

@article{arxiv.1011.0096,
  title  = {Concentration inequalities of the cross-validation estimator for Empirical Risk Minimiser},
  author = {Matthieu Cornec},
  journal= {arXiv preprint arXiv:1011.0096},
  year   = {2010}
}

备注

24 pages, 2 figures