中文

用于分组和层次变量选择的复合绝对惩罚族

统计理论 2009-09-03 v1 统计理论

摘要

从高维数据中提取有用信息是当今统计研究和实践的一个重要焦点。理论和经验均已证明,惩罚损失函数最小化对此任务有效。结合正则化和稀疏性的优点,基于L1L_1惩罚的平方误差最小化方法Lasso在回归模型及其他领域广受欢迎。在本文中,我们结合包括L1L_1在内的不同范数,构建一种智能惩罚,以便在回归或分类模型的拟合中加入辅助信息,从而获得合理的估计。具体而言,我们引入了复合绝对惩罚族,它允许表达预测变量之间给定的分组和层次关系。CAP惩罚通过定义组并组合组间和组内层面的范数惩罚性质来构建。对于非重叠组,可实现分组选择。通过定义具有特定重叠模式的组,可实现层次变量选择。我们建议使用BLASSO和交叉验证来一般性地计算CAP估计。对于仅涉及L1L_1LL_{\infty}范数的CAP估计子族,我们引入了iCAP算法来追踪分组选择问题的整个正则化路径。在该子族内,推导了自由度的无偏估计,从而无需交叉验证即可选择正则化参数。在一系列模拟实验中,包括pnp\gg n以及可能错误指定分组的情况,CAP被证明在预测性能上优于LASSO。当模型复杂度被正确计算时,iCAP在实验中表现出简约性。

关键词

引用

@article{arxiv.0909.0411,
  title  = {The composite absolute penalties family for grouped and hierarchical variable selection},
  author = {Peng Zhao and Guilherme Rocha and Bin Yu},
  journal= {arXiv preprint arXiv:0909.0411},
  year   = {2009}
}

备注

Published in at http://dx.doi.org/10.1214/07-AOS584 the Annals of Statistics (http://www.imstat.org/aos/) by the Institute of Mathematical Statistics (http://www.imstat.org)