排序稀疏性:用于选择与估计特征交互与多项式的清晰正则化框架
统计方法学
2022-01-28 v2
摘要
我们探讨并阐释排序稀疏性概念,该现象常自然发生于建模应用中,当不同特征集间存在预期的信息质量差异时。它的存在可致传统与现代模型选择方法失效,因这类过程通常假定每个潜在参数进入最终模型的资格等同——我们称此假定为“协变量均衡”。然而该假定并非总成立,尤其在衍生变量存在时。例如,当所有可能出现的交互均作为候选预测变量时,协变量均衡前提常产生过度设定且不透明的模型。额外候选变量的庞大数量极大膨胀了交互中的假发现数,导致不必要复杂且难解释的模型,含许多(确为虚假的)交互。我们建议一种建模策略,要求更强证据水平才允许某些变量(如交互)被选入最终模型。此排序稀疏性范式可用稀疏排序lasso(SRL)实现。我们在系列模拟研究中比较SRL与竞争方法的表现,显示SRL因快速、准确且产生更透明模型(更少假交互)而极具吸引力。我们通过对一组基因表达测量与临床协变量预测肺癌患者存活的应用阐释其效用,尤寻基因-环境交互。
引用
@article{arxiv.2107.07594,
title = {Ranked Sparsity: A Cogent Regularization Framework for Selecting and Estimating Feature Interactions and Polynomials},
author = {Ryan A. Peterson and Joseph E. Cavanaugh},
journal= {arXiv preprint arXiv:2107.07594},
year = {2022}
}