Smooth-Lasso 及其他 $\ell_1+\ell_2$ 惩罚方法
统计理论
2011-10-12 v2 统计理论
摘要
我们考虑高维设置下的线性回归问题,其中协变量数量 可能远大于样本量 。在这种情况下,通常假设回归向量是稀疏的,即回归向量包含许多零分量。我们提出了一种基于两个惩罚项的Lasso型估计量 (其中 '' 代表二次)。第一个惩罚项是回归系数的 范数,用于像Lasso估计量那样利用回归的稀疏性;而第二个是二次惩罚项,用于捕获关于问题设置的一些额外信息。我们详细介绍了两种特殊情况:Elastic-Net ,它处理变量之间可能存在相关性的稀疏问题;以及Smooth-Lasso ,它处理已知连续回归系数缓慢变化的稀疏问题(在某些情况下,这也可以解释为连续变量之间的相关性)。从理论角度来看,我们建立了变量选择一致性结果,并表明 达到了稀疏性不等式,即关于'真实'回归向量非零分量数量的一个界。这些结果是在比Lasso所使用的Gram矩阵假设更弱的条件下提供的。在某些情况下,这保证了相对于Lasso的显著改进。此外,我们进行了模拟研究,表明S-Lasso 在估计精度方面优于已知方法,如Lasso、Elastic-Net 和Fused-Lasso。当回归向量是'平滑的'时,即当未知回归参数的连续系数之间的变化很小时,情况尤其如此。该研究还表明,调谐参数的理论校准和基于10折交叉验证的校准会产生性能相近的两种S-Lasso解。
引用
@article{arxiv.1003.4885,
title = {The Smooth-Lasso and other $\ell_1+\ell_2$-penalized methods},
author = {Mohamed Hebiri and Sara A. Van De Geer},
journal= {arXiv preprint arXiv:1003.4885},
year = {2011}
}