中文

一种指导岭回归中岭参数选择的半自动方法

应用统计 2012-05-04 v1 基因组学

摘要

我们考虑将一种流行的惩罚回归方法——岭回归(Ridge Regression)应用于具有非常高维度且协变量数量远多于观测值的数据。我们的动机是样本外预测问题,背景是来自全基因组关联研究或重测序研究的高密度基因型数据。此前已有研究表明,与其他惩罚回归方法相比,岭回归在预测方面能提供更好的性能。岭回归的一个问题是如何选择合适的参数来控制系数估计量的收缩程度。在此,我们提出了一种基于控制模型中预测观测值方差来选择岭参数的方法。利用模拟数据,我们证明了该方法在降低预测误差方面优于基于单变量关联检验的子集选择以及另一种惩罚回归方法 HyperLasso 回归。我们将该方法扩展至结果为二分类(代表病例和对照,这通常是全基因组关联研究的背景)的回归问题,并在一个真实数据示例中展示了该方法,该示例包含来自 Wellcome Trust Case Control Consortium 和 Genetic Association Information Network 的双相情感障碍病例 - 对照及基因型数据。

关键词

引用

@article{arxiv.1205.0686,
  title  = {A semi-automatic method to guide the choice of ridge parameter in ridge regression},
  author = {Erika Cule and Maria De Iorio},
  journal= {arXiv preprint arXiv:1205.0686},
  year   = {2012}
}