中文

关于Lasso再拟合策略

统计理论 2018-11-13 v3 应用统计 统计理论

摘要

l_1惩罚估计量的一个众所周知缺陷是大系数被系统性地向零收缩。一种简单的补救方法是将Lasso视为模型选择过程,并在所选支持集上执行第二步再拟合。本文中,我们形式化了再拟合的概念,并为Lasso解的任意再拟合过程提供Oracle界(oracle bounds)。最常用的基于最小二乘的再拟合技术可能带来可解释性问题,因为再拟合估计量的符号相对于原始估计量可能发生翻转。该问题源于最小二乘再拟合仅考虑Lasso解的支持集,而忽略有关符号或幅值的任何信息。为此,我们定义符号一致再拟合(sign consistent refitting)为一种保留第一步Lasso解符号的任意再拟合过程,并为此类估计量提供Oracle不等式(Oracle inequalities)。最后,我们考虑特殊的再拟合策略:Bregman Lasso与Boosted Lasso。Bregman Lasso具有一个有益性质,即收敛于符号最小二乘再拟合(Sign-Least-Squares refitting,即带符号约束的最小二乘),从而提供更好的可解释性。我们还研究了正交设计情形下的Bregman Lasso再拟合,为所提方法提供简单直观的解释。相反,Boosted Lasso考虑第一步Lasso的幅值信息,并允许为预测开发更好的Oracle率。最后,我们进行广泛的数值研究,以展示不同合成与半真实场景下各方法的优劣。

关键词

引用

@article{arxiv.1707.05232,
  title  = {On Lasso refitting strategies},
  author = {Evgenii Chzhen and Mohamed Hebiri and Joseph Salmon},
  journal= {arXiv preprint arXiv:1707.05232},
  year   = {2018}
}

备注

revised version