选取合适的正则化器:基于仿真基准测试的Scikit-learn正则化框架比较
机器学习
2026-04-08 v2 机器学习
摘要
本研究梳理了正则化的历史发展,追溯自1960年代的逐步回归,到最近在形式化误差控制、针对非独立特征的结构化惩罚、贝叶斯方法以及l0基正则化(以及其他技术)的最新进展。我们在134,400个仿真实验中对四个经典框架——Ridge、Lasso、ElasticNet和Post-Lasso OLS——进行了性能评估,这些仿真实验涵盖了一个以8个生产级机器学习模型为基础,导向7维流形的场景。我们的发现表明,在样本数足够多时(n/p >= 78),Ridge、Lasso和ElasticNet在预测准确度几乎可以互换。然而,我们发现Lasso在多重共线性情形下的召回率极其脆弱;在高条件数(kappa)和低信噪比(SNR)时,Lasso召回率跌至0.18,而ElasticNet可保持在0.93。因此,我们建议在高kappa且样本量较小的情况下不要使用Lasso或Post-Lasso OLS。分析 concludes with an objective-driven decision guide to assist machine learning engineers in selecting the optimal scikit-learn-supported framework based on observable feature space attributes.(分析以以目标为导向的决策指南收尾,帮助机器学习工程师根据可观测的特征空间属性选择最佳的Scikit-learn支持框架。)
引用
@article{arxiv.2604.03541,
title = {Choosing the Right Regularizer for Applied ML: Simulation Benchmarks of Popular Scikit-learn Regularization Frameworks},
author = {Benjamin S. Knight and Ahsaas Bajaj},
journal= {arXiv preprint arXiv:2604.03541},
year = {2026}
}