从泛化能力与VC理论视角看模型选择一致性及其在Lasso中的应用
机器学习
2016-06-02 v1 经济学
统计计算
摘要
模型选择难以分析但在理论和实证上十分重要,尤其对于高维数据分析。近来,最小绝对收缩与选择算子(Lasso)已应用于统计与计量经济文献中。Lasso的一致性已在多种条件下确立,其中部分条件在实践中难以验证。本文中,我们在结构风险最小化(SRM)和Vapnik-Chervonenkis(VC)理论框架下,从泛化能力视角研究模型选择。该方法强调样本内与样本外拟合之间的平衡,可通过交叉验证选择模型复杂度的惩罚项来实现。我们展示了模型的泛化能力与模型选择一致性之间存在精确关系。通过实施SRM和VC不等式,我们表明在类似于施加于OLS的假设下,Lasso对模型选择是L2一致的。此外,我们推导了带惩罚的极值估计量与无惩罚极值估计量之间距离的概率界,该距离由过拟合主导。我们还提出了一种基于泛化能力的过拟合新度量GR2,若模型选择一致则收敛于零。通过模拟,我们证明了所提出的CV-Lasso算法在模型选择和过拟合控制方面表现良好。
引用
@article{arxiv.1606.00142,
title = {Model selection consistency from the perspective of generalization ability and VC theory with an application to Lasso},
author = {Ning Xu and Jian Hong and Timothy C. G. Fisher},
journal= {arXiv preprint arXiv:1606.00142},
year = {2016}
}