中文

Smooth-Lasso 及其他 $\ell_1+\ell_2$ 惩罚方法

统计理论 2011-10-12 v2 统计理论

摘要

我们考虑高维设置下的线性回归问题,其中协变量数量 pp 可能远大于样本量 nn。在这种情况下,通常假设回归向量是稀疏的,即回归向量包含许多零分量。我们提出了一种基于两个惩罚项的Lasso型估计量 β^Quad\hat{\beta}^{Quad}(其中 'QuadQuad' 代表二次)。第一个惩罚项是回归系数的 1\ell_1 范数,用于像Lasso估计量那样利用回归的稀疏性;而第二个是二次惩罚项,用于捕获关于问题设置的一些额外信息。我们详细介绍了两种特殊情况:Elastic-Net β^EN\hat{\beta}^{EN},它处理变量之间可能存在相关性的稀疏问题;以及Smooth-Lasso β^SL\hat{\beta}^{SL},它处理已知连续回归系数缓慢变化的稀疏问题(在某些情况下,这也可以解释为连续变量之间的相关性)。从理论角度来看,我们建立了变量选择一致性结果,并表明 β^Quad\hat{\beta}^{Quad} 达到了稀疏性不等式,即关于'真实'回归向量非零分量数量的一个界。这些结果是在比Lasso所使用的Gram矩阵假设更弱的条件下提供的。在某些情况下,这保证了相对于Lasso的显著改进。此外,我们进行了模拟研究,表明S-Lasso β^SL\hat{\beta}^{SL} 在估计精度方面优于已知方法,如Lasso、Elastic-Net β^EN\hat{\beta}^{EN} 和Fused-Lasso。当回归向量是'平滑的'时,即当未知回归参数的连续系数之间的变化很小时,情况尤其如此。该研究还表明,调谐参数的理论校准和基于10折交叉验证的校准会产生性能相近的两种S-Lasso解。

关键词

引用

@article{arxiv.1003.4885,
  title  = {The Smooth-Lasso and other $\ell_1+\ell_2$-penalized methods},
  author = {Mohamed Hebiri and Sara A. Van De Geer},
  journal= {arXiv preprint arXiv:1003.4885},
  year   = {2011}
}