面向高维线性回归的稀疏性导向重要性学习
统计方法学
2016-08-03 v1
摘要
鉴于现在已被充分认识到的不可忽略的模型选择不确定性,数据分析师不应再满足于从模型选择过程中输出的单一最终模型,无论其多么复杂。为了提高模型选择的可靠性和可重复性,一种建设性的方法是充分利用可靠的变量重要性度量。尽管已有有趣的重要性度量并在数据分析中越来越多地被使用,但很少有理论上的证明。在本文中,我们从稀疏线性建模的角度提出了一种新的变量重要性度量,即稀疏性导向重要性学习(SOIL),通过使用合理的模型加权来考虑变量选择的不确定性。理论上证明了 SOIL 方法具有包含/排除性质:当模型权重恰当地围绕真实模型时,SOIL 重要性可以很好地将真实模型中的变量与其余变量区分开来。特别是,即使信号微弱,SOIL 也很少会给不在真实模型中的变量比在真实模型中的变量显著更高的重要性值。在几个说明性设置中的广泛模拟和带有引导模拟的真实数据示例表明,与其他重要性度量相比,SOIL 重要性具有理想的特性。
引用
@article{arxiv.1608.00629,
title = {Sparsity Oriented Importance Learning for High-dimensional Linear Regression},
author = {Chenglong Ye and Yi Yang and Yuhong Yang},
journal= {arXiv preprint arXiv:1608.00629},
year = {2016}
}