中文

泛化能力的有限样本与渐近分析及其在惩罚回归中的应用

机器学习 2016-09-14 v2 机器学习 统计理论 经济学 统计计算 统计理论

摘要

本文从泛化能力(GA)的角度研究极值估计量的性能:GA 是指模型在同一总体的新样本中预测结果的能力。通过调整经典集中不等式,我们推导出了样本外预测经验误差的上界,该上界是样本内误差、样本内数据规模、误差分布尾部厚度以及模型复杂度的函数。我们表明,误差界限可用于调整关键估计超参数,例如交叉验证中的折数 KK。我们还展示了 KK 如何影响交叉验证的偏差-方差权衡。我们证明,惩罚回归与相应的无惩罚回归估计量之间的 L2\mathcal{L}_2 范数差异可以直接由估计量的 GA 和经验矩条件的 GA 来解释。最后,我们证明所有惩罚回归估计量在 npn \geqslant pn<pn < p 情况下都是 L2L_2 一致的。通过仿真演示了关键结果。关键词:泛化能力,泛化误差上界,惩罚回归,交叉验证,偏差-方差权衡,惩罚与无惩罚回归之间的 L2\mathcal{L}_2 差异,lasso,高维数据。

关键词

引用

@article{arxiv.1609.03344,
  title  = {Finite-sample and asymptotic analysis of generalization ability with an application to penalized regression},
  author = {Ning Xu and Jian Hong and Timothy C. G. Fisher},
  journal= {arXiv preprint arXiv:1609.03344},
  year   = {2016}
}

备注

The theoretical generalization and extension of arXiv:1606.00142