中文

通过 $\ell_1$ 和 $\ell_1+\ell_2$ 惩罚在线性和逻辑回归模型中进行诚实变量选择

统计理论 2008-12-16 v2 统计理论

摘要

本文研究了在有限样本下通过 1\ell_11+2\ell_1+\ell_2 类型惩罚方案进行正确的变量选择。变量选择的渐近一致性可直接从该分析中得出。我们重点关注逻辑回归和线性回归模型。以下问题是本文的核心:给定置信水平 1δ1-\delta,在设计矩阵的何种假设下,对于何种强度的信号以及何种调节参数值,我们能够以给定的置信水平识别出真实模型?形式上,若 I^\widehat{I} 是真实变量集 II^* 的一个估计,我们研究在给定样本量 nn、参数个数 MM 和置信度 1δ1-\delta 的条件下,使得 P(I^=I)1δ\mathbb{P}(\widehat{I}=I^*)\geq 1-\delta 成立的条件。我们证明,在可识别模型中,两种方法都能恢复大小为 1n\frac{1}{\sqrt{n}} 的系数,仅相差小的乘法常数以及 MM1δ\frac{1}{\delta} 的对数因子。对于我们在此考虑的模型,在变量选择问题上,1+2\ell_1+\ell_2 惩罚相对于 1\ell_1 惩罚的优势很小。前者估计是唯一的,并且对于高度相关的数据矩阵,随着 2\ell_2 部分的调节参数增加会变得更稳定,但该参数值增加过大可能会妨碍变量选择。

关键词

引用

@article{arxiv.0808.4051,
  title  = {Honest variable selection in linear and logistic regression models via $\ell_1$ and $\ell_1+\ell_2$ penalization},
  author = {Florentina Bunea},
  journal= {arXiv preprint arXiv:0808.4051},
  year   = {2008}
}

备注

Published in at http://dx.doi.org/10.1214/08-EJS287 the Electronic Journal of Statistics (http://www.i-journals.org/ejs/) by the Institute of Mathematical Statistics (http://www.imstat.org)