Lasso 路径上的错误发现出现得很早
统计理论
2016-09-16 v4 信息论
math.IT
机器学习
统计理论
摘要
在解释变量相关性极低且效应相对较少、每个效应量级均很大的回归设定中,我们期望 Lasso 能够几乎无误地找到重要变量。本文表明,在线性稀疏性机制下——即具有非零效应的变量比例趋于一个常数,无论多么小——情况并非如此,即使设计变量是随机独立的。我们证明真实特征和无效特征在 Lasso 路径上总是交替出现,并且无论效应大小有多强,这种现象都会发生。我们推导了错误阳性率和真实阳性率之间,或等价地,Lasso 路径上 I 类和 II 类误差度量之间的渐近权衡关系。这种权衡关系表明,如果我们希望将 II 类误差(假阴性率)降至某个临界值以下,那么在 Lasso 路径上的任何位置,I 类误差(假阳性率)都需要超过给定的阈值,因此我们永远无法同时将两种误差保持在低水平。我们的分析使用了近似消息传递(AMP)理论中的工具以及处理 Lasso 正则化参数可能的自适应选择的新元素。
引用
@article{arxiv.1511.01957,
title = {False Discoveries Occur Early on the Lasso Path},
author = {Weijie Su and Malgorzata Bogdan and Emmanuel Candes},
journal= {arXiv preprint arXiv:1511.01957},
year = {2016}
}