中文

由于隐式岭正则化,真实世界高维数据的最优岭惩罚可能为零或负

统计理论 2024-06-06 v4 机器学习 统计理论

摘要

统计学习中的一个传统观念是,大模型需要强正则化以防止过拟合。在此我们表明,在现实条件下,欠定npn\ll p情形下的线性回归可能违背这一规则。利用模拟和真实生活高维数据集,我们证明显式正岭惩罚可能无法提供优于最小范数最小二乘估计量的任何改进。此外,在这种情况下岭惩罚的最优值可能为负。当预测变量空间中的高方差方向能够预测响应变量时(真实世界高维数据中通常如此),就会发生这种情况。在此情形下,低方差方向提供了隐式岭正则化,并可能使任何进一步的正岭惩罚产生有害影响。我们证明,用随机协变量扩充任何线性模型并使用最小范数估计量,渐近等价于添加岭惩罚。我们使用尖峰协方差模型作为一个可解析处理的例子,并证明当npn\ll p时该情况下的最优岭惩罚为负。

关键词

引用

@article{arxiv.1805.10939,
  title  = {Optimal ridge penalty for real-world high-dimensional data can be zero or negative due to the implicit ridge regularization},
  author = {Dmitry Kobak and Jonathan Lomond and Benoit Sanchez},
  journal= {arXiv preprint arXiv:1805.10939},
  year   = {2024}
}