中文

利用 HORSES 进行回归收缩与高度相关预测变量的分组

机器学习 2013-02-04 v1

摘要

在具有高度相关预测变量的高维数据分析中,识别变量的同质子群可能具有挑战性。我们提出了一种名为“带收缩与等式选择的六边形回归算子”(Hexagonal Operator for Regression with Shrinkage and Equality Selection,简称 HORSES)的新方法,该方法可同时选择正相关变量并将其识别为预测簇。这是通过一个约束最小二乘问题实现的,其正则化项由系数的 L1L_1 惩罚与系数成对差值的另一个 L1L_1 惩罚的线性组合构成。这种惩罚函数的设定鼓励对正相关预测变量进行分组,并结合稀疏解。我们构建了一种高效算法来实现 HORSES 过程。模拟结果表明,该方法在预测误差和简约性方面优于其他变量选择方法。该技术在两个数据集上得到了演示:一个是来自阿巴拉契亚土壤分析的小型数据集,另一个是来自近红外(NIR)光谱研究的高维数据集,展示了该方法的灵活性。

关键词

引用

@article{arxiv.1302.0256,
  title  = {Regression shrinkage and grouping of highly correlated predictors with HORSES},
  author = {Woncheol Jang and Johan Lim and Nicole A. Lazar and Ji Meng Loh and Donghyeon Yu},
  journal= {arXiv preprint arXiv:1302.0256},
  year   = {2013}
}