中文

用于高斯设计高维单指标模型支撑恢复的L1正则化最小二乘

统计理论 2016-06-24 v3 机器学习 统计理论

摘要

已知对于某类单指标模型(SIMs)Y=f(Xp×1β0,ε)Y = f(\boldsymbol{X}_{p \times 1}^\intercal\boldsymbol{\beta}_0, \varepsilon),当XN(0,Ip×p)\boldsymbol{X} \sim \mathcal{N}(0, \mathbb{I}_{p \times p})且模型复杂度调整后的样本量低于临界阈值时,支撑恢复是不可能的。近期,提出了基于切片逆回归(SIR)的最优算法。这些算法在设计与X\boldsymbol{X}来自i.i.d.高斯分布的假设下可证明有效。本文中,我们分析基于协方差筛选与带L1L_1惩罚的最小二乘(即LASSO)的算法,并证明它们在支撑恢复方面也能享有最优(直至标量因子)重缩放样本量,尽管关于ffε\varepsilon的假设与基于SIR的算法略有不同。此外,我们更一般地证明,若XN(0,Σ)\boldsymbol{X} \sim \mathcal{N}(0, \boldsymbol{\Sigma})且协方差Σ\boldsymbol{\Sigma}满足不可表示条件,则LASSO能成功恢复β0\boldsymbol{\beta}_0的符号支撑。我们的工作将现有关于线性模型LASSO支撑恢复的结果推广到更广义的SIMs类。

关键词

引用

@article{arxiv.1511.08102,
  title  = {L1-Regularized Least Squares for Support Recovery of High Dimensional Single Index Models with Gaussian Designs},
  author = {Matey Neykov and Jun S. Liu and Tianxi Cai},
  journal= {arXiv preprint arXiv:1511.08102},
  year   = {2016}
}

备注

36 pages; 6 figures; typos corrected; clearer notation introduced